Wissen

Web Data Collection für akademische Forschung: Reproduzierbarkeit, Ethikprüfung und wie man einen gescrapten Datensatz zitiert

Gescrapte Daten sind in der Forschung inzwischen üblich, aber oft schwer zu reproduzieren, zu prüfen oder zu zitieren. Wie man Webdaten sammelt, die Peer Review, Ethikkommissionen und Weiterverwendung standhalten.

James Meadow

6. Oktober 2026 · 10 Min. Lesezeit

Webdaten sind zu einem gewöhnlichen Forschungsmaterial geworden. Sozialwissenschaftler untersuchen Plattformdiskurse, Ökonomen verfolgen Online-Preise, Informatiker bauen Korpora auf, und Public-Health-Forscher verfolgen Falschinformationen. Vieles davon wird mit Scrapern gesammelt, und vieles davon teilt dieselben Schwächen: Niemand außerhalb des Teams kann die Sammlung reproduzieren, die Ethikprüfung wurde für Umfragen geschrieben, und der Datensatz wird als „von den Autoren gesammelte Daten” zitiert, oder gar nicht.

Nichts davon ist unausweichlich. Einige Praktiken, die meisten davon günstig, machen gescrapte Daten reproduzierbar, überprüfbar und zitierbar. Dieser Leitfaden behandelt, wie man eine Sammlung gestaltet, die ein Peer Review übersteht, was ein Ethikgremium sehen muss, wie man den Datensatz verpackt und zitiert, sowie ein kleines getestetes Skript, das die Zitations- und Manifestdateien erzeugt.

Die wichtigsten Punkte

  • Das Web verändert sich und unterscheidet sich je nach Betrachter, sodass ein gescrapter Datensatz nicht durch erneutes Ausführen des Scrapers reproduziert werden kann. Reproduzierbarkeit bedeutet, genau aufzuzeichnen, was gesammelt wurde, wann, von wo und wie, und es zu bewahren.
  • Schreiben Sie das Sammlungsprotokoll vor der Sammlung, und behandeln Sie Änderungen daran als Ergänzungen, wie bei jeder anderen Methode auch.
  • Die Ethikprüfung für Webdaten hängt von Erwartungen, Schaden und Identifizierbarkeit ab, nicht nur davon, ob die Daten öffentlich sind. Bringen Sie einen Datenmanagementplan mit, nicht nur einen Einwilligungsverzicht.
  • Verpacken Sie den Datensatz mit einem Manifest aus Datei-Hashes und Sammlungskontext, einer Lizenz und einer CITATION.cff-Datei, und hinterlegen Sie ihn dort, wo er einen persistenten Identifikator erhält.
  • Zitieren Sie den Datensatz als eigenständiges Forschungsergebnis, mit Version und Identifikator, neben dem Paper.

Warum gescrapte Daten schwer zu reproduzieren sind

Das erneute Ausführen desselben Codes ein Jahr später erzeugt nicht dieselben Daten. Seiten ändern sich, verschwinden und ziehen um. Viele Websites zeigen unterschiedliche Inhalte je nach Land, Sprache, Gerät oder Anmeldestatus. Plattformen ändern ihr Markup und ihre Zugriffsregeln. Und die Sammlung selbst ist verlustbehaftet: Blockaden, Timeouts und Ratenbegrenzungen lassen Datensätze ungleichmäßig ausfallen, oft auf Weisen, die mit genau den Dingen korrelieren, die untersucht werden.

Reproduzierbarkeit für Webdaten beruht daher auf drei Dingen statt auf erneuter Sammlung:

  1. Dokumentation der Methode in ausreichendem Detail, sodass jemand versuchen könnte, dieselbe Sammlung durchzuführen und verstehen könnte, warum sein Ergebnis abweicht.
  2. Bewahrung dessen, was tatsächlich gesammelt wurde, idealerweise die rohen Antworten ebenso wie die extrahierten Daten.
  3. Rechenschaft darüber, was nicht gesammelt wurde: Fehlschläge, Ausschlüsse und Filterung, mit Zählungen.

Die Sammlung wie ein Instrument gestalten

Behandeln Sie den Scraper als Messinstrument und schreiben Sie dessen Protokoll, bevor die Sammlung beginnt:

ProtokollelementWas aufzuzeichnen ist
Population und StichprobeWelche Quellen es gibt, wie sie ausgewählt wurden, und was im und außerhalb des Geltungsbereichs liegt
SammlungszeitraumStart- und Enddatum sowie Uhrzeiten in UTC, und der Zeitplan für wiederholte Sammlung
Standpunkt (Vantage Point)Das Land, der Netzwerktyp, die Sprache und das Geräteprofil, das der Sammler präsentierte, da viele Websites danach variieren
WerkzeugeCode-Repository und Commit, Bibliotheksversionen, Browserversion, falls eine verwendet wurde
ZugriffsregelnWie robots.txt, Nutzungsbedingungen und Ratenbegrenzungen gehandhabt wurden, und das Anfragetempo
FehlerbehandlungWiederholungsversuche, was als fehlgeschlagener Datensatz gilt, und wie Fehlschläge protokolliert werden
VerarbeitungExtraktions-, Bereinigungs-, Deduplizierungs- und Filterschritte, jeweils mit Zählungen vorher und nachher

Zwei davon fehlen regelmäßig in Papers. Der Standpunkt ist wichtig, weil dieselbe URL unterschiedlichen Besuchern unterschiedliche Inhalte liefern kann, ein Problem, von dem wir argumentieren, dass es standardmäßig aufgezeichnet werden sollte, in dem Plädoyer für einen Vantage-Point-Standard. Und Fehlerzählungen sind wichtig, weil ein Datensatz, dem 8% seiner Einträge fehlen, nur interpretierbar ist, wenn Leser wissen, welche 8% es sind.

Wo die Studie es erlaubt, bewahren Sie die rohen Antworten ebenso wie die extrahierten Daten auf. Sie im standardisierten WARC-Format zu speichern, wie in die rohe Antwort bewahren beschrieben, ermöglicht es Ihnen und späteren Forschern, genau aus dem neu zu extrahieren, was zum damaligen Zeitpunkt gesammelt wurde, falls sich herausstellt, dass der Parser fehlerhaft war.

Ethikprüfung

Viele institutionelle Ethikverfahren wurden für die Einwilligung von Teilnehmern konzipiert, und Webdaten passen nicht ohne weiteres dazu. Forscher argumentieren oft, dass öffentliche Daten keine Prüfung benötigen; Gremien antworten oft mit Anforderungen, die für Interviews konzipiert sind. Ein besseres Gespräch beginnt mit den Fragen, die tatsächlich zählen. Die Ethikrichtlinien der Association of Internet Researchers, in ihrer dritten Version 2019 verabschiedet, rahmen die Ethik der Internetforschung um den Kontext, in dem Daten geteilt wurden, und das Schadenspotenzial über den gesamten Forschungslebenszyklus, statt um ein Etikett öffentlich oder privat.

Fragen, die ein Ethikantrag für Webdaten beantworten sollte:

  • Wessen Daten sind es, und was haben sie erwartet? Die Preisliste eines Unternehmens, die öffentlichen Äußerungen eines Politikers und der Forumsbeitrag eines Teenagers sind alle „öffentlich”, mit sehr unterschiedlichen Erwartungen.
  • Können Personen identifiziert werden, direkt oder durch Kombination? Zitate können zu ihren Autoren zurückgesucht werden; das Aggregieren von Quellen kann Personen identifizieren, die keine einzelne Quelle identifizieren würde.
  • Welcher Schaden könnte folgen, und für wen? Erwägen Sie Bloßstellung, Belästigung und Diskriminierung, besonders für gefährdete Gruppen oder sensible Themen.
  • Wie werden Daten minimiert und geschützt? Was nicht gesammelt wird, wie Identifikatoren pseudonymisiert werden, wer Zugriff hat, wo sie gespeichert werden, und wann sie gelöscht werden.
  • Was wird veröffentlicht? Aggregate, umschriebene Zitate oder Rohdatensätze; und ob ein geteilter Datensatz Zugriffskontrollen benötigt.

Nutzungsbedingungen und Recht sind separate Fragen von der Ethik, und beide benötigen eine Antwort. Fiesler, Beard und Keegan untersuchten die Datensammlungsbestimmungen in den Nutzungsbedingungen von mehr als hundert Social-Media-Websites, in einer auf der ICWSM 2020 vorgestellten Studie, und argumentierten, dass Nutzungsbedingungen allein eine schlechte Grundlage für ethische Entscheidungen in beide Richtungen sind. Auf der rechtlichen Seite haben Forschungsnutzungen oft spezifische Bestimmungen; das EU-Urheberrecht etwa enthält eine Ausnahme für Text- und Data-Mining durch Forschungsorganisationen, und das Datenschutzrecht gilt für personenbezogene Daten unabhängig davon, ob sie öffentlich sind. Unsere Übersichten zu ob Web Scraping legal ist und DSGVO und Datensammlung sind ein Ausgangspunkt; die Rechts- und Datenschutzbeauftragten Ihrer Institution sind die Autorität für Ihr Projekt.

Robots.txt verdient einen Satz in jedem Protokoll. Es ist kein Gesetz, aber es ist die klarste maschinenlesbare Aussage darüber, was eine Website will, und es zu respektieren ist leicht zu rechtfertigen; robots.txt, KI-Opt-outs und Reservierungssignale behandelt, was die Signale bedeuten.

Den Datensatz verpacken

Ein Datensatz, der zitiert und wiederverwendet werden kann, braucht mehr als die Datendateien:

  • Ein Manifest, das jede Datei mit ihrer Größe und einem kryptografischen Hash auflistet, plus den Sammlungskontext aus dem Protokoll. Hashes ermöglichen es jedem, zu bestätigen, dass er genau die Dateien hat, die das Paper verwendet hat.
  • Eine README, die die Felder, die Methode, bekannte Lücken und beschreibt, wie die Daten verantwortungsvoll zu nutzen sind.
  • Eine Lizenz für das, was Sie teilen dürfen, und eine klare Aussage darüber, was Sie nicht teilen konnten und warum.
  • Eine CITATION.cff-Datei, das reine Textformat Citation File Format, das GitHub, Zenodo und Literaturverwaltungsprogramme lesen, sodass jeder den Datensatz mit einem Klick korrekt zitieren kann.

Die untenstehende Funktion schreibt das Manifest und die CITATION.cff aus einem Ordner mit Datendateien und einer Beschreibung der Sammlung:

import hashlib
import json
from datetime import date
from pathlib import Path


def sha256(path):
    digest = hashlib.sha256()
    with open(path, "rb") as f:
        for block in iter(lambda: f.read(1 << 20), b""):
            digest.update(block)
    return digest.hexdigest()


def write_dataset_package(folder, title, authors, collection, version="1.0.0"):
    """Write a manifest (what was collected, how, and file hashes) and a CITATION.cff for a scraped dataset."""
    folder = Path(folder)
    files = sorted(p for p in folder.rglob("*") if p.is_file() and p.name not in ("MANIFEST.json", "CITATION.cff"))
    manifest = {
        "title": title,
        "version": version,
        "collection": collection,  # sources, window, vantage point, tool and code version, robots policy
        "files": [{"path": str(p.relative_to(folder)), "bytes": p.stat().st_size, "sha256": sha256(p)} for p in files],
    }
    (folder / "MANIFEST.json").write_text(json.dumps(manifest, indent=2) + "\n", encoding="utf-8")

    lines = [
        "cff-version: 1.2.0",
        'message: "If you use this dataset, please cite it as below."',
        "type: dataset",
        f"title: {json.dumps(title)}",
        f"version: {json.dumps(version)}",
        f"date-released: {date.today().isoformat()}",
        "authors:",
    ]
    for person in authors:
        lines.append(f"  - family-names: {json.dumps(person['family'])}")
        lines.append(f"    given-names: {json.dumps(person['given'])}")
        if person.get("orcid"):
            lines.append(f"    orcid: {json.dumps(person['orcid'])}")
    abstract = (f"Collected {collection['window']} from {', '.join(collection['sources'])}. "
                "See MANIFEST.json for method and file hashes.")
    lines.append(f"abstract: {json.dumps(abstract)}")  # JSON strings are valid YAML, so quotes cannot break the file
    (folder / "CITATION.cff").write_text("\n".join(lines) + "\n", encoding="utf-8")
    return manifest

Angewendet auf einen kleinen Beispieldatensatz:

from package import write_dataset_package

manifest = write_dataset_package(
    "dataset",
    title="Robots.txt rules for AI crawlers on the top 10,000 domains",
    authors=[{"family": "Example", "given": "Researcher", "orcid": "https://orcid.org/0000-0002-1825-0097"}],
    collection={
        "sources": ["robots.txt files of the Tranco top 10,000 domains"],
        "window": "on 6 October 2026",
        "vantage_point": "one network in Romania",
        "tool": "survey.py at commit 3f2a9c1",
        "robots_policy": "only robots.txt itself was requested",
    },
)
print(len(manifest["files"]), "files listed")

Die gezeigte ORCID ist ORCIDs eigener veröffentlichter Beispiel-Identifikator; verwenden Sie Ihre eigene. Wir haben die erzeugte Datei mit cffconvert, dem Referenzwerkzeug des Formats, validiert, das meldete: „Citation metadata are valid according to schema version 1.2.0”, und bestätigt, dass sie gültig bleibt, wenn Titel und Namen Anführungszeichen und Apostrophe enthalten, woran naive Vorlagen scheitern. Die APA-Stil-Ausgabe des Werkzeugs für das Beispiel lautet: „Example R. (2026). Robots.txt rules for AI crawlers on the top 10,000 domains (version 1.0.0).”

Hinterlegen und zitieren

Ein Datensatz in einem Laborordner oder einem persönlichen GitHub-Repository kann verschwinden. Hinterlegen Sie ihn in einem Repository, das einen persistenten Identifikator vergibt:

  • Allgemeine Repositorien wie Zenodo, betrieben vom CERN, vergeben eine DOI für jeden Upload, kostenlos, mit einer Standardgrenze von 50 GB pro Eintrag.
  • Institutionelle und fachspezifische Repositorien könnten von Ihrem Fördergeber gefordert sein oder bessere Auffindbarkeit in Ihrem Fachgebiet bieten.
  • Eingeschränkter Zugriff ist eine Option, wenn Daten nicht vollständig öffentlich sein können: Hinterlegen Sie das Manifest und die Dokumentation offen, und die Daten selbst unter kontrolliertem Zugriff.

Die FAIR-Prinzipien, veröffentlicht in Scientific Data 2016, fassen zusammen, was die Hinterlegung erreichen sollte: Die Daten sollten auffindbar, zugänglich, interoperabel und wiederverwendbar sein, für Menschen und für Maschinen.

Zitieren Sie dann den Datensatz im Paper als eigenständige Referenz, mit Autoren, Jahr, Titel, Version, Repository und Identifikator, nicht nur als Satz im Methodenabschnitt. Zitieren Sie die genaue Version, die Sie analysiert haben, und veröffentlichen Sie eine neue Version mit einem neuen Identifikator, wenn sich die Daten ändern.

Eine Checkliste

  • Protokoll vor der Sammlung geschrieben, mit Stichprobe, Zeitraum, Standpunkt, Werkzeugen, Zugriffsregeln und Fehlerbehandlung.
  • Ethikantrag, der Erwartungen, Identifizierbarkeit, Schaden, Minimierung und Veröffentlichung abdeckt.
  • Rohe Antworten bewahrt, wo die Studie es erlaubt, und jeder Verarbeitungsschritt gezählt.
  • Manifest mit Datei-Hashes und Sammlungskontext, README, Lizenz und CITATION.cff.
  • Hinterlegung mit einem persistenten Identifikator, und eine versionierte Datensatzzitation im Paper.

Dieselbe Disziplin gilt auch außerhalb der Wissenschaft; großangelegte Trainingsdatensätze aufbauen behandelt es für maschinelle Lernkorpora.

Fazit

Gescrapte Daten können rigoroses Forschungsmaterial sein, aber nur, wenn sie als solches behandelt werden: gesammelt nach einem schriftlichen Protokoll, geprüft auf die Ethik ihres Kontexts statt auf ihr öffentliches Etikett, bewahrt mit ausreichendem Detail, um zu erklären, was gesehen wurde, und veröffentlicht als zitierbares, versioniertes Ergebnis.

Das meiste davon ist Dokumentation und Verpackung, einmal am Anfang und einmal am Ende erledigt. Es ist der Unterschied zwischen einem Datensatz, der ein Paper unterstützt, und einem, der ein ganzes Fachgebiet unterstützt.

Quellen und Referenzen

  • Association of Internet Researchers, Internet Research: Ethical Guidelines 3.0, 2019.
  • Wilkinson et al., The FAIR Guiding Principles for scientific data management and stewardship, Scientific Data, 2016.
  • Fiesler, Beard und Keegan, No Robots, Spiders, or Scrapers: Legal and Ethical Regulation of Data Collection Methods in Social Media Terms of Service, ICWSM 2020.
  • Citation File Format, Version 1.2.0, und der cffconvert-Validator.
  • Zenodo, betrieben vom CERN.
  • Code getestet von Shifter am 6. Oktober 2026.

Bereit, loszulegen?

Testen Sie Shifters Residential-Proxys, 205M+ IPs, 195+ Länder, ab 0,75 $/GB.

Jetzt starten