Wissen

Eine Richtlinie zur Unternehmensdatenerfassung verfassen: Eine praxistaugliche Vorlage

Die meisten Teams, die Webdaten erfassen, haben dafür keine schriftlichen Regeln. Eine praxistaugliche Vorlage: Umfang, Freigaben, Quellen, personenbezogene Daten und Löschanfragen.

Matt Brown

Matt Brown

4. Oktober 2026 · 10 Min. Lesezeit

Die meisten Unternehmen, die Webdaten sammeln, haben dafür keine schriftlichen Regeln. Ein Entwickler baut einen Scraper für ein Preisprojekt, ein anderes Team kopiert ihn für die Lead-Recherche, ein Auftragnehmer fügt einen dritten hinzu, und niemand kann sagen, welche Websites erfasst werden, welche personenbezogenen Daten gespeichert werden oder wer auf eine Beschwerde eines Website-Betreibers antworten würde. Die Arbeit ist meist in Ordnung. Das Problem ist, dass niemand zeigen kann, dass sie in Ordnung ist.

Eine kurze interne Richtlinie behebt das. Sie gibt Entwicklern klare Standardvorgaben, gibt den Rechts- und Sicherheitsteams etwas, das sie einmal statt jedes Mal prüfen müssen, und liefert dem Unternehmen eine Antwort, wenn ein Kunde, ein Prüfer oder eine Website fragt, wie es Daten sammelt. Dieser Leitfaden erklärt, was eine solche Richtlinie abdecken muss, und bietet eine Vorlage, die Sie anpassen können.

Wichtigste Erkenntnisse

  • Eine Erfassungsrichtlinie sollte so kurz sein, dass Entwickler sie tatsächlich lesen: Geltungsbereich, ein Genehmigungsschritt, Regeln für Quellen, Regeln für personenbezogene Daten und was passiert, wenn jemand widerspricht.
  • Machen Sie den sicheren Weg zum Standard. Öffentliche, nicht eingeloggte Seiten, ehrliche Identifizierung, moderates Tempo und die Einhaltung von robots.txt benötigen keine besondere Genehmigung; alles andere schon.
  • Behandeln Sie Widersprüche als Widersprüche. Die französische Datenschutzbehörde beispielsweise erwartet, dass Sammler Websites ausschließen, die über robots.txt oder CAPTCHAs widersprechen.
  • Personenbezogene Daten verändern alles: Definieren Sie, was Sie erfassen dürfen, minimieren Sie sie bereits bei der Erfassung, legen Sie Aufbewahrungsfristen fest und ermöglichen Sie die Löschung.
  • Benennen Sie einen Verantwortlichen und einen Takedown-Prozess. Die erste Beschwerde ist der falsche Zeitpunkt, um zu entscheiden, wer sie beantwortet.
  • Diese Vorlage ist ein Ausgangspunkt, keine Rechtsberatung; lassen Sie sie von einem Anwalt im Hinblick auf Ihre Rechtsordnungen und Verträge prüfen.

Warum eine schriftliche Richtlinie wichtig ist

Es gibt drei praktische Gründe.

Konsistenz. Ohne schriftliche Regeln trifft jedes Projekt seine eigenen Entscheidungen zu robots.txt, Tempo, personenbezogenen Daten und Aufbewahrung. Manche sind sorgfältig, manche nicht, und das Unternehmen trägt das Risiko des am wenigsten sorgfältigen Projekts.

Geschwindigkeit. Eine Richtlinie mit klaren Standardvorgaben erlaubt es den meisten Projekten, ohne Meeting zu starten. Recht und Sicherheit prüfen die Richtlinie einmal und danach nur noch die Ausnahmen.

Nachweis. Datenschutzbehörden erwarten, dass Verantwortliche zeigen können, welche Schutzmaßnahmen sie anwenden. Die französische Datenschutzbehörde CNIL beispielsweise hat eine Anleitung zur Erfassung personenbezogener Daten durch Web Scraping veröffentlicht, die Maßnahmen auflistet wie die vorherige Festlegung von Erfassungskriterien, den Ausschluss von Websites, die eindeutig widersprechen, unter anderem über robots.txt oder CAPTCHAs, das Herausfiltern unnötiger Daten und das Löschen sensibler Daten, sobald sie erkannt werden. Eine schriftliche Richtlinie ist die Art und Weise, wie Sie zeigen, dass diese Maßnahmen bestehen.

Was die Richtlinie abdecken muss

AbschnittDie Frage, die er beantwortet
Zweck und GeltungsbereichFür welche Aktivitäten und Teams gilt dies?
RollenWer ist für die Richtlinie verantwortlich, wer genehmigt Projekte, wer beantwortet Beschwerden?
StandardregelnWas kann jedes Projekt tun, ohne nachzufragen?
GenehmigungWas benötigt eine Freigabe, von wem, mit welchen Informationen?
QuellenWelche Websites und Seiten sind zulässig, und wie behandeln wir ihre Signale?
Personenbezogene DatenWas dürfen wir über Personen erfassen, und wie minimieren und schützen wir es?
Technisches VerhaltenWie identifizieren sich Sammler, wie takten sie Anfragen und wie gehen sie mit Zugangsdaten um?
AnbieterWas verlangen wir von Proxy- und Datenanbietern?
Speicherung und AufbewahrungWo liegen erfasste Daten, wer kann darauf zugreifen, wie lange bewahren wir sie auf?
Widersprüche und TakedownsWas passiert, wenn ein Website-Betreiber, eine Person oder eine Aufsichtsbehörde widerspricht?
Aufzeichnungen und ÜberprüfungWas protokollieren wir, und wann überprüfen wir die Richtlinie?

Die Vorlage

Passen Sie den Wortlaut an Ihr Unternehmen an, löschen Sie, was nicht zutrifft, und halten Sie es kurz. Text in Klammern ist von Ihnen auszufüllen.

1. Zweck und Geltungsbereich

Diese Richtlinie regelt die automatisierte Erfassung von Daten von Websites und Online-Diensten durch [Unternehmen], seine Mitarbeiter und seine Auftragnehmer, einschließlich Scrapern, Crawlern, Browser-Automatisierung und Daten, die von Dritten gekauft werden, die in unserem Auftrag erfassen. Sie gilt nicht für Daten, die uns unsere eigenen Nutzer geben, oder für offizielle APIs, die unter ihren eigenen Bedingungen genutzt werden, außer dort, wo Abschnitt 6 zutrifft.

2. Rollen

  • Richtlinienverantwortlicher: [Rolle, zum Beispiel Head of Data] pflegt diese Richtlinie und das Register der Erfassungsprojekte.
  • Genehmigende: [Rechtskontakt] und [Sicherheitskontakt] genehmigen Projekte, die gemäß Abschnitt 4 eine Genehmigung benötigen.
  • Projektverantwortlicher: Jedes Erfassungsprojekt benennt eine Person, die für die Einhaltung dieser Richtlinie verantwortlich ist.
  • Takedown-Kontakt: [Rolle und gemeinsames Postfach] nimmt Widersprüche gemäß Abschnitt 10 entgegen und beantwortet sie.

3. Standardregeln für jedes Projekt

Jedes Projekt kann ohne weitere Genehmigung fortfahren, wenn es:

  • nur öffentlich zugängliche Seiten erfasst, die jeder Besucher ohne Anmeldung sehen kann;
  • robots.txt und andere maschinenlesbare Opt-outs einhält, die für den Sammler gelten;
  • den Sammler ehrlich identifiziert und automatisierten Traffic nicht als eine bestimmte Person tarnt;
  • Anfragen so taktet, dass sie keine spürbare Last auf dem Ziel erzeugen;
  • keine personenbezogenen Daten über das hinaus erfasst, was Abschnitt 6 erlaubt;
  • vor dem Start im Projektregister erfasst wird.

4. Projekte, die eine Genehmigung benötigen

Ein Projekt benötigt vor dem Start eine schriftliche Genehmigung der Genehmigenden, wenn es:

  • personenbezogene Daten über geschäftliche Kontaktdaten hinaus erfasst, die zu geschäftlichen Zwecken veröffentlicht wurden;
  • besondere Kategorien von Daten erfasst, wie Gesundheit, Religion oder politische Meinung;
  • von Seiten hinter einem Login, einer Paywall oder einer anderen Zugangskontrolle erfasst;
  • fortgesetzt wird, nachdem eine Website ihren Widerspruch gezeigt hat, unter anderem über robots.txt, ein CAPTCHA, eine Sperrung, eine Vertragsklausel oder eine direkte Anfrage;
  • für das Training, Fine-Tuning oder die Bewertung von Machine-Learning-Modellen erfasst;
  • die erfassten Daten außerhalb von [Unternehmen] verkauft, lizenziert oder teilt.

Der Antrag gibt den Zweck, die Quellen, die Datenfelder, etwaige personenbezogene Daten und deren Rechtsgrundlage, das erwartete Volumen, die Aufbewahrungsfrist und den Projektverantwortlichen an.

5. Quellen und ihre Signale

  • Bevorzugen Sie eine offizielle API, einen Datenfeed oder eine Lizenz, wenn eine solche existiert und den Bedarf abdeckt.
  • Lesen und dokumentieren Sie die relevanten Bedingungen jeder Quelle, bevor die Erfassung beginnt.
  • Behandeln Sie robots.txt, Ratenbegrenzungen, CAPTCHAs, Sperrungen und veröffentlichte Vorbehalte als Signale der Wünsche der Website, nicht als Hindernisse, die es zu umgehen gilt.
  • Umgehen Sie keine Zugangskontrollen, technischen Schutzmaßnahmen oder Authentifizierungen.
  • Stellen Sie die Erfassung von einer Quelle umgehend ein, wenn diese widerspricht, und dokumentieren Sie die Einstellung im Register.

6. Personenbezogene Daten

  • Erfassen Sie nur die personenbezogenen Daten, die der angegebene Zweck benötigt, und filtern Sie andere personenbezogene Daten nach Möglichkeit bereits bei der Erfassung heraus.
  • Erfassen Sie niemals besondere Kategorien von Daten, es sei denn, dies wurde gemäß Abschnitt 4 genehmigt; werden sie versehentlich erfasst, löschen Sie sie, sobald sie erkannt werden.
  • Pseudonymisieren Sie Identifikatoren, wenn die Analyse die Identität selbst nicht benötigt.
  • Kombinieren Sie erfasste Daten nicht mit anderen Quellen, um Einzelpersonen zu identifizieren, es sei denn, dies wurde genehmigt.
  • Ermöglichen Sie es, die Daten einer Person auf Anfrage zu finden und zu löschen.

7. Technisches Verhalten

  • Speichern Sie Zugangsdaten für Proxys, APIs und Zielkonten im genehmigten Secrets-Manager, niemals im Code.
  • Verwenden Sie nur Proxy- und Datenanbieter, die Abschnitt 8 erfüllen.
  • Dokumentieren Sie für jeden Erfassungslauf die Zeit, die Quelle, den Erfassungsstandort und die verwendete Konfiguration.
  • Überwachen Sie Anfragevolumen und Fehlerraten, und pausieren Sie die Erfassung automatisch, wenn eine Quelle beginnt, Anfragen abzulehnen.

8. Anbieter

Proxy- und Datenanbieter müssen zeigen können, wie ihr Netzwerk oder ihre Daten beschafft werden und mit welcher Einwilligung, einen Know-your-Customer-Prozess betreiben, eine Acceptable-Use-Policy durchsetzen und Bedingungen unterzeichnen, die mit dieser Richtlinie übereinstimmen. Der Richtlinienverantwortliche führt eine Liste der genehmigten Anbieter.

9. Speicherung und Aufbewahrung

  • Speichern Sie erfasste Daten nur in [genehmigten Systemen], mit auf die Personen beschränktem Zugriff, die ihn benötigen.
  • Bewahren Sie rohe erfasste Seiten nicht länger als [Zeitraum] und extrahierte Daten nicht länger als [Zeitraum] auf, sofern eine Genehmigung keinen anderen Zeitraum festlegt.
  • Löschen Sie Daten am Ende ihrer Aufbewahrungsfrist und dokumentieren Sie die Löschung.

10. Widersprüche und Takedowns

  • Jeder Widerspruch eines Website-Betreibers, einer Einzelperson oder einer Behörde geht innerhalb von [einem Arbeitstag] an den Takedown-Kontakt.
  • Die betroffene Erfassung wird pausiert, während der Widerspruch geprüft wird, sofern die Rechtsabteilung nichts anderes empfiehlt.
  • Der Takedown-Kontakt antwortet innerhalb von [Zeitraum] und dokumentiert den Widerspruch, die Entscheidung und alle gelöschten Daten.
  • Wiederholte Widersprüche zum selben Projekt lösen eine Überprüfung der Genehmigung dieses Projekts aus.

11. Aufzeichnungen und Überprüfung

Der Richtlinienverantwortliche führt das Projektregister, die Genehmigungen, die Anbieterliste und das Takedown-Protokoll und überprüft diese Richtlinie mindestens [jährlich] sowie immer dann, wenn sich das Recht oder die Aktivitäten des Unternehmens wesentlich ändern.

Damit die Richtlinie wirkt

Eine Richtlinie, die nur auf einem gemeinsamen Laufwerk liegt, ändert nichts. Ein paar Gewohnheiten machen sie real:

  • Platzieren Sie das Register dort, wo Projekte beginnen. Ein kurzes Formular in dem Tool, das Entwickler ohnehin schon nutzen, mit den Standardregeln als Checkboxen, erfasst Projekte, bevor sie entstehen, statt danach.
  • Bauen Sie die Standardvorgaben in den Code ein. Eine gemeinsame Erfassungsbibliothek, die robots.txt einhält, einen ehrlichen User-Agent setzt, Anfragen taktet und den Erfassungskontext dokumentiert, macht die Richtlinie zum einfachen Weg statt zu einem zusätzlichen Schritt. robots.txt und KI-Opt-outs respektieren behandelt, welche Signale zu beachten sind.
  • Dokumentieren Sie, wo Daten beobachtet wurden. Die Protokollierung von Zeit, Standort und Konfiguration pro Lauf ist das, was erfasste Daten später verteidigungsfähig macht, wie in das Plädoyer für einen Vantage-Point-Standard dargelegt.
  • Überprüfen Sie Ihre Anbieter. Fragen Sie Proxy-Anbieter, wie sie ihre IPs beschaffen, und sehen Sie sich wie Anbieter Residential-IPs ethisch beschaffen und die Malware-Ökonomie hinter billigen Proxys an, um zu verstehen, warum das wichtig ist.
  • Halten Sie Secrets aus dem Code heraus. Scraper in CI/CD betreiben zeigt, wie Proxy-Zugangsdaten sicher gehandhabt werden.
  • Lesen Sie die Signale, bevor Sie bauen. Eine kurze Prüfung dessen, was eine Quelle schützt, wie in unserer Anti-Bot-Stack-Abfrage, zeigt Ihnen frühzeitig, ob ein Projekt unter die Standardregeln fällt oder eine Genehmigung benötigt.

Für das umfassendere rechtliche Bild siehe ist Web Scraping legal und Residential-Proxys und DSGVO; für die tägliche Praxis Best Practices für Web Scraping.

Fazit

Eine Datenerfassungsrichtlinie muss nicht lang sein. Sie braucht einen klaren Geltungsbereich, sichere Standardvorgaben, die den Großteil der Arbeit fortsetzen lassen, einen Genehmigungsschritt für die riskanten Fälle, feste Regeln für personenbezogene Daten und eine benannte Person, die antwortet, wenn jemand widerspricht.

Schreiben Sie sie einmal, bauen Sie ihre Standardvorgaben in die Tools ein, die Entwickler verwenden, und halten Sie das Register aktuell. Wenn dann das nächste Mal jemand fragt, wie Ihr Unternehmen Webdaten erfasst, ist die Antwort ein Dokument statt hektischer Suche. Passen Sie die Vorlage an Ihre Situation an, und lassen Sie sie von einem Anwalt prüfen, bevor Sie sie übernehmen.

Quellen und Referenzen

Bereit, loszulegen?

Testen Sie Shifters Residential-Proxys, 205M+ IPs, 195+ Länder, ab 0,75 $/GB.

Jetzt starten