Jeder Web-Crawl enthält inzwischen maschinell erzeugten Text: Produktseiten, die von einem Modell geschrieben wurden, Content-Farm-Artikel, die zu Tausenden produziert werden, Bewertungen und Forenbeiträge, die kein Mensch verfasst hat. Für viele Zwecke ist das harmlos. Für Trainingsdaten, Evaluationssets und Retrieval-Korpora ist es das nicht, und der Anteil wächst stetig.
Die unbequeme Tatsache ist, dass kein Detektor generierten Text dokumentweise zuverlässig identifiziert. Was funktioniert, ist ein mehrstufiger Ansatz: mehrere schwache Signale kombiniert, an den eigenen Daten kalibriert und mit einer Richtlinie angewandt, die zum Zweck des Datensatzes passt. Dieser Leitfaden behandelt die Signale, wie man sie kombiniert und wie man Daten so erfasst, dass Filterung überhaupt möglich ist.
Die allgemeine Pipeline zum Aufbau eines gescrapten Datensatzes, einschließlich Deduplizierung und Provenienz, findet sich in how to build a dataset with web scraping. Dieser Leitfaden konzentriert sich speziell auf das Problem generierter Inhalte.
Warum das je nach Anwendungsfall wichtig ist
| Datensatz-Verwendung | Risiko durch generierte Inhalte | Typische Toleranz |
|---|---|---|
| Modell-Pretraining | Vereinheitlichter Stil, verstärkte Fehler, Verlust seltenen Wissens | Moderat, mit Down-Weighting |
| Evaluation und Benchmarks | Testitems, die Modellausgaben widerspiegeln, verzerren Ergebnisse | Sehr gering |
| Retrieval-Korpora für RAG | Sicher wirkende, aber falsche Passagen werden als Fakten abgerufen | Gering bei kritischen Antworten |
| Markt- und Social-Analytics | Gefälschte Bewertungen und Beiträge verzerren Zahlen und Stimmung | Gering |
Für das Training ist das Problem gut dokumentiert. Veröffentlichte Forschung hat gezeigt, dass Modelle, die wiederholt auf der Ausgabe früherer Modelle trainiert werden, die selteneren Teile der ursprünglichen Datenverteilung verlieren, ein Fehler, der als Model Collapse beschrieben wird. Für Analytics ist das Problem einfacher: Ein Stimmungstrend, der auf generierten Bewertungen basiert, misst eine Marketingkampagne, keine Kunden. Dieses Problem wird von der Erfassungsseite aus in scraping social platforms for sentiment analysis behandelt.
Warum ein einzelner Detektor nicht ausreicht
KI-Text-Klassifikatoren sind verlockend, da sie einen Score pro Dokument zurückgeben. In der Praxis sind sie genau unter den Bedingungen unzuverlässig, die für Webdaten relevant sind.
- Kurze Texte geben ihnen zu wenig Material.
- Umformulierter oder leicht bearbeiteter Text wird oft als menschlich durchgelassen.
- Nicht-englische Sprachen sind meist schlechter abgedeckt.
- Manche menschliche Texte werden viel zu oft markiert. Studien haben ergeben, dass Detektoren Texte von nicht-englischen Muttersprachlern deutlich häufiger als maschinell generiert einstufen.
Ein großes KI-Labor hat 2023 seinen eigenen öffentlichen Text-Klassifikator zurückgezogen und dabei geringe Genauigkeit als Grund angegeben. Behandeln Sie einen Klassifikator-Score als eines von mehreren schwachen Merkmalen, niemals als Urteil.
Signale, die zusammen besser funktionieren
Provenienz und Zeit
Das stärkste einzelne Signal steckt gar nicht im Text selbst. Es ist der Zeitpunkt, zu dem der Inhalt erstmals beobachtet wurde.
Generative Textmodelle wurden Ende 2022 breit öffentlich verfügbar. Inhalte, die vor diesem Zeitpunkt erstmals beobachtet wurden, sind viel unwahrscheinlicher maschinell generiert, unabhängig davon, was ein Klassifikator dazu sagt. Inhalte, die erst danach erstmals gesehen wurden, sind nicht automatisch verdächtig, aber die Priorwahrscheinlichkeit ändert sich.
Das funktioniert nur, wenn Sie Beobachtungszeitpunkte erfassen. Speichern Sie für jedes Dokument bei der Erfassung einen First-Seen-Zeitstempel, bewahren Sie ihn durch jede Kopie und Transformation hindurch und crawlen Sie periodisch erneut, damit Sie Seiten erkennen können, die später heimlich umgeschrieben wurden. Die Argumentation dafür, wann und wo eine Beobachtung gemacht wurde als Teil der Daten zu behandeln, findet sich in the vantage-point standard.
Signale auf Quellenebene
Generierte Inhalte werden meist im großen Stil von wenigen Betreibern produziert, was Quellen leichter zu bewerten macht als einzelne Dokumente. Bewerten Sie Domains und Bereiche, nicht nur einzelne Seiten.
- Veröffentlichungsgeschwindigkeit. Eine Domain, die von wenigen Seiten pro Monat auf Tausende pro Woche gesprungen ist.
- Vorlagen-Einheitlichkeit. Viele Seiten teilen sich eine Struktur und ein Überschriftenmuster, unterscheiden sich nur im eingesetzten Thema.
- Themenweitläufigkeit. Eine einzelne Site behandelt unzusammenhängende Themen mit einheitlicher Tiefe.
- Fehlende Rechenschaft. Keine Autorenangabe, keine Über-uns-Seite, keine Kontaktdaten oder erfundene Autorennamen.
- Monetarisierungsdichte. Seiten, die hauptsächlich existieren, um Affiliate-Links oder Werbung zu tragen.
Near-Duplicates und Vorlagen
Content-Farmen produzieren tendenziell viele Umformulierungen desselben Grundgerüsts. Near-Duplicate-Erkennung, typischerweise MinHash mit Locality-Sensitive Hashing über geshingelten Text, gruppiert diese Variationen zusammen. Ein großer Cluster nahezu identischer Seiten über viele Domains hinweg ist ein starkes Signal für Massenproduktion, und den Cluster manuell zu prüfen ist weit schneller, als Seiten einzeln zu prüfen.
Bewahren Sie das rohe HTML für Quellen auf, die Sie auf diese Weise analysieren möchten, da die Vorlage selbst oft ein deutlicheres Erkennungsmerkmal ist als der Text.
Dokumentstatistiken
Statistische Eigenschaften des Textes können helfen, solange sie als schwache Evidenz behandelt werden. Sehr niedrige Perplexität unter einem Referenz-Sprachmodell, geringe Variation in Satzlänge und -struktur und starker Einsatz generischer Füllformulierungen sind alle mit generiertem Text assoziiert.
Jedes davon ist auch bei manchen menschlichen Texten üblich: einfache Dokumentation, formelhafte Nachrichtenmeldungen und Text von nicht-englischen Muttersprachlern. Verwenden Sie sie nur in Kombination und kalibrieren Sie sie pro Sprache.
Watermarks, wo vorhanden
Manche Modellanbieter betten statistische Watermarks in generierten Text ein, und einige haben Erkennungswerkzeuge veröffentlicht. Wo ein Watermark vorhanden und erkennbar ist, ist das ein starkes Indiz. Es deckt nur Text von teilnehmenden Modellen ab, kann nur mit dem Detektor des Anbieters überprüft werden, und Umformulierung oder Übersetzung schwächt es ab. Behandeln Sie ein positives Ergebnis als aussagekräftig und ein negatives als uninformativ.
| Signal | Stärke | Hauptschwäche |
|---|---|---|
| First-Seen-Datum | Stark bei älteren Inhalten | Erfordert bei der Erfassung erfasste Zeitstempel |
| Muster auf Quellenebene | Stark auf Domain-Ebene | Übersieht einmalige generierte Seiten auf guten Sites |
| Near-Duplicate-Cluster | Stark bei Content-Farmen | Übersieht originale, einmalige Generierung |
| Dokumentstatistiken | Allein schwach | Benachteiligt einfache und nicht-native Texte |
| Klassifikator-Score | Allein schwach | Unzuverlässig bei kurzen, bearbeiteten oder nicht-englischen Texten |
| Watermark | Stark bei positivem Ergebnis | Fehlt bei den meisten Texten |
Von Signalen zu einer Filterrichtlinie
Kombinieren Sie die Signale zu einem einzigen Score pro Dokument, wobei Scores auf Quellenebene in die Dokument-Scores einfließen. Entscheiden Sie dann, was mit jedem Score-Bereich zu tun ist, und lassen Sie die Entscheidung vom Zweck des Datensatzes abhängen.
- Behalten Sie Dokumente, die klar menschlich bewertet werden oder vor Ihrem Stichdatum erstmals beobachtet wurden.
- Down-Weighting Sie Grenzfall-Dokumente in Pretraining-Mischungen, statt sie zu entfernen.
- Quarantänieren Sie wahrscheinlich generierte Dokumente in einem separaten Speicher, sodass die Entscheidung überarbeitet werden kann, wenn sich der Filter verbessert.
- Entfernen Sie nur, wo der Anwendungsfall es erfordert, etwa bei Evaluationssets, wo Kontamination den größten Schaden anrichtet.
Versionieren Sie den Filter und dokumentieren Sie, welche Version welche Teilmenge erzeugt hat. Ein Filter ist eine Sammlung von Entscheidungen über die Daten, und jeder, der den Datensatz später verwendet, muss wissen, was diese Entscheidungen waren.
Nicht alle synthetischen Daten sind unerwünscht. Absichtlich generierte Trainingsdaten haben legitime Anwendungen. Das Problem sind generierte Inhalte, die unmarkiert eintreffen und für menschlich geschriebenen Text gehalten werden. Wo Sie also selbst synthetische Daten erzeugen, kennzeichnen Sie sie an der Quelle.
Den Filter messen, einschließlich wen er fälschlich ausschließt
Ein Filter, den niemand gemessen hat, ist eine Vermutung.
Bauen Sie ein gelabeltes Validierungsset aus Ihrem eigenen Crawl: Dokumente aus Quellen, die Sie als menschlich verfasst kennen, eine Stichprobe, die Sie selbst mit aktuellen Modellen über Ihre Zielsprachen hinweg generieren, und eine zufällige Auswahl von Grenzfällen, die manuell überprüft werden. Messen Sie Precision und Recall pro Sprache und pro Domain.
Prüfen Sie dann die falschen Positiven gezielt. Wenn der Filter überproportional Texte von nicht-englischen Muttersprachlern, einfache technische Dokumentation oder bestimmte Regionen entfernt, verengt er den Datensatz still und leise auf eine Weise, die sich später als Modell zeigen wird, das diesen Nutzern schlechter dient. Das breitere Risiko eines unausgewogenen Datensatzes wird in your residential proxy pool is a sample, not the internet behandelt.
Führen Sie die Evaluation regelmäßig erneut durch. Generatoren verbessern sich, und ein Filter, der letztes Quartal funktioniert hat, kann sich verschlechtern, ohne dass es jemand bemerkt.
So erfassen, dass Filterung überhaupt möglich ist
Die meisten nützlichen Signale hängen von Entscheidungen ab, die zum Zeitpunkt der Erfassung getroffen werden.
- Erfassen Sie First-Seen-Zeitstempel für jedes Dokument und bewahren Sie sie durch jede Transformation hindurch.
- Speichern Sie Quellmetadaten: Domain, Bereich, Veröffentlichungsdatum, wo angegeben, und den Vantage Point, von dem aus die Seite beobachtet wurde.
- Bewahren Sie rohe Antworten für Quellen auf, die Sie möglicherweise auf Vorlagen hin analysieren müssen, und landen Sie sie vor dem Parsen, sodass ein besserer Filter erneut angewandt werden kann, ohne neu erfassen zu müssen. Das Muster findet sich in moving web scraping API data into SQL.
- Crawlen Sie nach Zeitplan erneut, um Seiten zu erkennen, die nach der ersten Erfassung umgeschrieben wurden.
- Bevorzugen Sie primäre menschliche Quellen: Foren, regionale Sites, Dokumentation und Fachpublikationen, statt Aggregatoren, die diese wiederverwerten.
Viele der besten menschlich verfassten Quellen sind regional und stark abgesichert. Sie vom richtigen Land aus zu erreichen, konsistent genug, um erneut zu crawlen, ist der Punkt, an dem Erfassungsinfrastruktur wichtig wird. Beim Shifter-Gateway wird der Markt in den Zugangsdaten gegen p.shifter.io:443 festgelegt, und das Weglassen einer Session-Kennung rotiert den Exit pro Anfrage, was sich für unabhängige Seitenabrufe eignet:
customer-USERNAME-country-br:PASSWORD
Erfassen Sie verantwortungsvoll: respektieren Sie die Nutzungsbedingungen jeder Site, halten Sie die Anfragerate angemessen und vermeiden Sie die Erfassung personenbezogener Daten, die Sie nicht benötigen. Der breitere Rahmen findet sich in ethical residential proxies for AI data collection.
FAQ
Kann KI-generierter Text zuverlässig erkannt werden?
Nicht zuverlässig bei einzelnen Dokumenten. Kombinierte Signale über Quellen, Cluster und Zeitstempel hinweg funktionieren auf Datensatzebene weit besser als jeder Klassifikator pro Dokument.
Sollten alle generierten Inhalte aus einem Trainingsset entfernt werden?
Nicht unbedingt. Down-Weighting von Grenzfall-Inhalten und die Kennzeichnung absichtlicher synthetischer Daten ist meist besser als aggressive Entfernung, die auch viele menschliche Texte entfernt.
Verringert Filterung die Vielfalt eines Datensatzes?
Das kann sie, wenn der Filter einfache oder nicht-native Texte benachteiligt. Prüfen Sie falsche Positive nach Sprache und Region, bevor Sie einen Filter im großen Maßstab anwenden.
Ist es sicher, Inhalte von vor Ende 2022 als menschlich verfasst zu behandeln?
Es ist eine starke Prior-Annahme, keine Garantie. Auch früher gab es automatisierte Inhalte. Kombinieren Sie das Datum mit den anderen Signalen.
Fazit
Es gibt keinen Schalter, der KI-generierte Inhalte aus einem Web-Datensatz entfernt. Es gibt eine Reihe von Signalen, die jeweils etwas Evidenz liefern: wann Inhalt erstmals beobachtet wurde, wie sich seine Quelle verhält, ob er zu einem Cluster von Near-Duplicates gehört, wie seine Statistiken aussehen, und gelegentlich ein Watermark. Kombiniert, an den eigenen Daten kalibriert und mit einer zum Zweck des Datensatzes passenden Richtlinie angewandt, funktionieren sie.
Das meiste davon hängt davon ab, von Anfang an mit Zeitstempeln, Quellmetadaten und rohen Antworten zu erfassen. Die Produktansicht findet sich auf der Seite AI and machine learning data collection, und die Erfassungsseite wird in collecting web data for AI training behandelt.