Die meisten Unternehmen, die Webdaten sammeln, haben dafür keine schriftlichen Regeln. Ein Entwickler baut einen Scraper für ein Preisprojekt, ein anderes Team kopiert ihn für die Lead-Recherche, ein Auftragnehmer fügt einen dritten hinzu, und niemand kann sagen, welche Websites erfasst werden, welche personenbezogenen Daten gespeichert werden oder wer auf eine Beschwerde eines Website-Betreibers antworten würde. Die Arbeit ist meist in Ordnung. Das Problem ist, dass niemand zeigen kann, dass sie in Ordnung ist.
Eine kurze interne Richtlinie behebt das. Sie gibt Entwicklern klare Standardvorgaben, gibt den Rechts- und Sicherheitsteams etwas, das sie einmal statt jedes Mal prüfen müssen, und liefert dem Unternehmen eine Antwort, wenn ein Kunde, ein Prüfer oder eine Website fragt, wie es Daten sammelt. Dieser Leitfaden erklärt, was eine solche Richtlinie abdecken muss, und bietet eine Vorlage, die Sie anpassen können.
Wichtigste Erkenntnisse
- Eine Erfassungsrichtlinie sollte so kurz sein, dass Entwickler sie tatsächlich lesen: Geltungsbereich, ein Genehmigungsschritt, Regeln für Quellen, Regeln für personenbezogene Daten und was passiert, wenn jemand widerspricht.
- Machen Sie den sicheren Weg zum Standard. Öffentliche, nicht eingeloggte Seiten, ehrliche Identifizierung, moderates Tempo und die Einhaltung von robots.txt benötigen keine besondere Genehmigung; alles andere schon.
- Behandeln Sie Widersprüche als Widersprüche. Die französische Datenschutzbehörde beispielsweise erwartet, dass Sammler Websites ausschließen, die über robots.txt oder CAPTCHAs widersprechen.
- Personenbezogene Daten verändern alles: Definieren Sie, was Sie erfassen dürfen, minimieren Sie sie bereits bei der Erfassung, legen Sie Aufbewahrungsfristen fest und ermöglichen Sie die Löschung.
- Benennen Sie einen Verantwortlichen und einen Takedown-Prozess. Die erste Beschwerde ist der falsche Zeitpunkt, um zu entscheiden, wer sie beantwortet.
- Diese Vorlage ist ein Ausgangspunkt, keine Rechtsberatung; lassen Sie sie von einem Anwalt im Hinblick auf Ihre Rechtsordnungen und Verträge prüfen.
Warum eine schriftliche Richtlinie wichtig ist
Es gibt drei praktische Gründe.
Konsistenz. Ohne schriftliche Regeln trifft jedes Projekt seine eigenen Entscheidungen zu robots.txt, Tempo, personenbezogenen Daten und Aufbewahrung. Manche sind sorgfältig, manche nicht, und das Unternehmen trägt das Risiko des am wenigsten sorgfältigen Projekts.
Geschwindigkeit. Eine Richtlinie mit klaren Standardvorgaben erlaubt es den meisten Projekten, ohne Meeting zu starten. Recht und Sicherheit prüfen die Richtlinie einmal und danach nur noch die Ausnahmen.
Nachweis. Datenschutzbehörden erwarten, dass Verantwortliche zeigen können, welche Schutzmaßnahmen sie anwenden. Die französische Datenschutzbehörde CNIL beispielsweise hat eine Anleitung zur Erfassung personenbezogener Daten durch Web Scraping veröffentlicht, die Maßnahmen auflistet wie die vorherige Festlegung von Erfassungskriterien, den Ausschluss von Websites, die eindeutig widersprechen, unter anderem über robots.txt oder CAPTCHAs, das Herausfiltern unnötiger Daten und das Löschen sensibler Daten, sobald sie erkannt werden. Eine schriftliche Richtlinie ist die Art und Weise, wie Sie zeigen, dass diese Maßnahmen bestehen.
Was die Richtlinie abdecken muss
| Abschnitt | Die Frage, die er beantwortet |
|---|---|
| Zweck und Geltungsbereich | Für welche Aktivitäten und Teams gilt dies? |
| Rollen | Wer ist für die Richtlinie verantwortlich, wer genehmigt Projekte, wer beantwortet Beschwerden? |
| Standardregeln | Was kann jedes Projekt tun, ohne nachzufragen? |
| Genehmigung | Was benötigt eine Freigabe, von wem, mit welchen Informationen? |
| Quellen | Welche Websites und Seiten sind zulässig, und wie behandeln wir ihre Signale? |
| Personenbezogene Daten | Was dürfen wir über Personen erfassen, und wie minimieren und schützen wir es? |
| Technisches Verhalten | Wie identifizieren sich Sammler, wie takten sie Anfragen und wie gehen sie mit Zugangsdaten um? |
| Anbieter | Was verlangen wir von Proxy- und Datenanbietern? |
| Speicherung und Aufbewahrung | Wo liegen erfasste Daten, wer kann darauf zugreifen, wie lange bewahren wir sie auf? |
| Widersprüche und Takedowns | Was passiert, wenn ein Website-Betreiber, eine Person oder eine Aufsichtsbehörde widerspricht? |
| Aufzeichnungen und Überprüfung | Was protokollieren wir, und wann überprüfen wir die Richtlinie? |
Die Vorlage
Passen Sie den Wortlaut an Ihr Unternehmen an, löschen Sie, was nicht zutrifft, und halten Sie es kurz. Text in Klammern ist von Ihnen auszufüllen.
1. Zweck und Geltungsbereich
Diese Richtlinie regelt die automatisierte Erfassung von Daten von Websites und Online-Diensten durch [Unternehmen], seine Mitarbeiter und seine Auftragnehmer, einschließlich Scrapern, Crawlern, Browser-Automatisierung und Daten, die von Dritten gekauft werden, die in unserem Auftrag erfassen. Sie gilt nicht für Daten, die uns unsere eigenen Nutzer geben, oder für offizielle APIs, die unter ihren eigenen Bedingungen genutzt werden, außer dort, wo Abschnitt 6 zutrifft.
2. Rollen
- Richtlinienverantwortlicher: [Rolle, zum Beispiel Head of Data] pflegt diese Richtlinie und das Register der Erfassungsprojekte.
- Genehmigende: [Rechtskontakt] und [Sicherheitskontakt] genehmigen Projekte, die gemäß Abschnitt 4 eine Genehmigung benötigen.
- Projektverantwortlicher: Jedes Erfassungsprojekt benennt eine Person, die für die Einhaltung dieser Richtlinie verantwortlich ist.
- Takedown-Kontakt: [Rolle und gemeinsames Postfach] nimmt Widersprüche gemäß Abschnitt 10 entgegen und beantwortet sie.
3. Standardregeln für jedes Projekt
Jedes Projekt kann ohne weitere Genehmigung fortfahren, wenn es:
- nur öffentlich zugängliche Seiten erfasst, die jeder Besucher ohne Anmeldung sehen kann;
- robots.txt und andere maschinenlesbare Opt-outs einhält, die für den Sammler gelten;
- den Sammler ehrlich identifiziert und automatisierten Traffic nicht als eine bestimmte Person tarnt;
- Anfragen so taktet, dass sie keine spürbare Last auf dem Ziel erzeugen;
- keine personenbezogenen Daten über das hinaus erfasst, was Abschnitt 6 erlaubt;
- vor dem Start im Projektregister erfasst wird.
4. Projekte, die eine Genehmigung benötigen
Ein Projekt benötigt vor dem Start eine schriftliche Genehmigung der Genehmigenden, wenn es:
- personenbezogene Daten über geschäftliche Kontaktdaten hinaus erfasst, die zu geschäftlichen Zwecken veröffentlicht wurden;
- besondere Kategorien von Daten erfasst, wie Gesundheit, Religion oder politische Meinung;
- von Seiten hinter einem Login, einer Paywall oder einer anderen Zugangskontrolle erfasst;
- fortgesetzt wird, nachdem eine Website ihren Widerspruch gezeigt hat, unter anderem über robots.txt, ein CAPTCHA, eine Sperrung, eine Vertragsklausel oder eine direkte Anfrage;
- für das Training, Fine-Tuning oder die Bewertung von Machine-Learning-Modellen erfasst;
- die erfassten Daten außerhalb von [Unternehmen] verkauft, lizenziert oder teilt.
Der Antrag gibt den Zweck, die Quellen, die Datenfelder, etwaige personenbezogene Daten und deren Rechtsgrundlage, das erwartete Volumen, die Aufbewahrungsfrist und den Projektverantwortlichen an.
5. Quellen und ihre Signale
- Bevorzugen Sie eine offizielle API, einen Datenfeed oder eine Lizenz, wenn eine solche existiert und den Bedarf abdeckt.
- Lesen und dokumentieren Sie die relevanten Bedingungen jeder Quelle, bevor die Erfassung beginnt.
- Behandeln Sie robots.txt, Ratenbegrenzungen, CAPTCHAs, Sperrungen und veröffentlichte Vorbehalte als Signale der Wünsche der Website, nicht als Hindernisse, die es zu umgehen gilt.
- Umgehen Sie keine Zugangskontrollen, technischen Schutzmaßnahmen oder Authentifizierungen.
- Stellen Sie die Erfassung von einer Quelle umgehend ein, wenn diese widerspricht, und dokumentieren Sie die Einstellung im Register.
6. Personenbezogene Daten
- Erfassen Sie nur die personenbezogenen Daten, die der angegebene Zweck benötigt, und filtern Sie andere personenbezogene Daten nach Möglichkeit bereits bei der Erfassung heraus.
- Erfassen Sie niemals besondere Kategorien von Daten, es sei denn, dies wurde gemäß Abschnitt 4 genehmigt; werden sie versehentlich erfasst, löschen Sie sie, sobald sie erkannt werden.
- Pseudonymisieren Sie Identifikatoren, wenn die Analyse die Identität selbst nicht benötigt.
- Kombinieren Sie erfasste Daten nicht mit anderen Quellen, um Einzelpersonen zu identifizieren, es sei denn, dies wurde genehmigt.
- Ermöglichen Sie es, die Daten einer Person auf Anfrage zu finden und zu löschen.
7. Technisches Verhalten
- Speichern Sie Zugangsdaten für Proxys, APIs und Zielkonten im genehmigten Secrets-Manager, niemals im Code.
- Verwenden Sie nur Proxy- und Datenanbieter, die Abschnitt 8 erfüllen.
- Dokumentieren Sie für jeden Erfassungslauf die Zeit, die Quelle, den Erfassungsstandort und die verwendete Konfiguration.
- Überwachen Sie Anfragevolumen und Fehlerraten, und pausieren Sie die Erfassung automatisch, wenn eine Quelle beginnt, Anfragen abzulehnen.
8. Anbieter
Proxy- und Datenanbieter müssen zeigen können, wie ihr Netzwerk oder ihre Daten beschafft werden und mit welcher Einwilligung, einen Know-your-Customer-Prozess betreiben, eine Acceptable-Use-Policy durchsetzen und Bedingungen unterzeichnen, die mit dieser Richtlinie übereinstimmen. Der Richtlinienverantwortliche führt eine Liste der genehmigten Anbieter.
9. Speicherung und Aufbewahrung
- Speichern Sie erfasste Daten nur in [genehmigten Systemen], mit auf die Personen beschränktem Zugriff, die ihn benötigen.
- Bewahren Sie rohe erfasste Seiten nicht länger als [Zeitraum] und extrahierte Daten nicht länger als [Zeitraum] auf, sofern eine Genehmigung keinen anderen Zeitraum festlegt.
- Löschen Sie Daten am Ende ihrer Aufbewahrungsfrist und dokumentieren Sie die Löschung.
10. Widersprüche und Takedowns
- Jeder Widerspruch eines Website-Betreibers, einer Einzelperson oder einer Behörde geht innerhalb von [einem Arbeitstag] an den Takedown-Kontakt.
- Die betroffene Erfassung wird pausiert, während der Widerspruch geprüft wird, sofern die Rechtsabteilung nichts anderes empfiehlt.
- Der Takedown-Kontakt antwortet innerhalb von [Zeitraum] und dokumentiert den Widerspruch, die Entscheidung und alle gelöschten Daten.
- Wiederholte Widersprüche zum selben Projekt lösen eine Überprüfung der Genehmigung dieses Projekts aus.
11. Aufzeichnungen und Überprüfung
Der Richtlinienverantwortliche führt das Projektregister, die Genehmigungen, die Anbieterliste und das Takedown-Protokoll und überprüft diese Richtlinie mindestens [jährlich] sowie immer dann, wenn sich das Recht oder die Aktivitäten des Unternehmens wesentlich ändern.
Damit die Richtlinie wirkt
Eine Richtlinie, die nur auf einem gemeinsamen Laufwerk liegt, ändert nichts. Ein paar Gewohnheiten machen sie real:
- Platzieren Sie das Register dort, wo Projekte beginnen. Ein kurzes Formular in dem Tool, das Entwickler ohnehin schon nutzen, mit den Standardregeln als Checkboxen, erfasst Projekte, bevor sie entstehen, statt danach.
- Bauen Sie die Standardvorgaben in den Code ein. Eine gemeinsame Erfassungsbibliothek, die robots.txt einhält, einen ehrlichen User-Agent setzt, Anfragen taktet und den Erfassungskontext dokumentiert, macht die Richtlinie zum einfachen Weg statt zu einem zusätzlichen Schritt. robots.txt und KI-Opt-outs respektieren behandelt, welche Signale zu beachten sind.
- Dokumentieren Sie, wo Daten beobachtet wurden. Die Protokollierung von Zeit, Standort und Konfiguration pro Lauf ist das, was erfasste Daten später verteidigungsfähig macht, wie in das Plädoyer für einen Vantage-Point-Standard dargelegt.
- Überprüfen Sie Ihre Anbieter. Fragen Sie Proxy-Anbieter, wie sie ihre IPs beschaffen, und sehen Sie sich wie Anbieter Residential-IPs ethisch beschaffen und die Malware-Ökonomie hinter billigen Proxys an, um zu verstehen, warum das wichtig ist.
- Halten Sie Secrets aus dem Code heraus. Scraper in CI/CD betreiben zeigt, wie Proxy-Zugangsdaten sicher gehandhabt werden.
- Lesen Sie die Signale, bevor Sie bauen. Eine kurze Prüfung dessen, was eine Quelle schützt, wie in unserer Anti-Bot-Stack-Abfrage, zeigt Ihnen frühzeitig, ob ein Projekt unter die Standardregeln fällt oder eine Genehmigung benötigt.
Für das umfassendere rechtliche Bild siehe ist Web Scraping legal und Residential-Proxys und DSGVO; für die tägliche Praxis Best Practices für Web Scraping.
Fazit
Eine Datenerfassungsrichtlinie muss nicht lang sein. Sie braucht einen klaren Geltungsbereich, sichere Standardvorgaben, die den Großteil der Arbeit fortsetzen lassen, einen Genehmigungsschritt für die riskanten Fälle, feste Regeln für personenbezogene Daten und eine benannte Person, die antwortet, wenn jemand widerspricht.
Schreiben Sie sie einmal, bauen Sie ihre Standardvorgaben in die Tools ein, die Entwickler verwenden, und halten Sie das Register aktuell. Wenn dann das nächste Mal jemand fragt, wie Ihr Unternehmen Webdaten erfasst, ist die Antwort ein Dokument statt hektischer Suche. Passen Sie die Vorlage an Ihre Situation an, und lassen Sie sie von einem Anwalt prüfen, bevor Sie sie übernehmen.