Base de connaissances

Comment détecter et filtrer le contenu généré par IA dans les jeux de données web

Aucun détecteur ne repère de manière fiable un texte généré par IA à lui seul. Comment les équipes ML combinent les signaux de provenance, de source, de duplication et statistiques pour filtrer les jeux de données web.

Chris Collins

Chris Collins

18 septembre 2026 · 11 min de lecture

Chaque exploration du web contient désormais du texte généré par machine : des pages produits rédigées par un modèle, des articles de fermes de contenu produits par milliers, des avis et des messages de forum que personne n’a écrits. Pour de nombreux usages, c’est sans conséquence. Pour les données d’entraînement, les jeux d’évaluation et les corpus de recherche documentaire, ça ne l’est pas, et la part continue de croître.

Le fait dérangeant est qu’aucun détecteur n’identifie de manière fiable le texte généré document par document. Ce qui fonctionne, c’est une approche par couches : plusieurs signaux faibles combinés, calibrés sur vos propres données, et appliqués avec une politique adaptée à l’usage du jeu de données. Ce guide couvre les signaux, comment les combiner, et comment collecter les données pour que le filtrage soit possible.

Le pipeline général de construction d’un jeu de données par scraping, incluant la déduplication et la provenance, se trouve dans comment construire un jeu de données par web scraping. Ce guide se concentre spécifiquement sur le problème du contenu généré.

Pourquoi c’est important, selon l’usage

Usage du jeu de donnéesRisque lié au contenu généréTolérance typique
Pré-entraînement de modèleStyle homogénéisé, erreurs amplifiées, perte de connaissances raresModérée, avec pondération réduite
Évaluation et benchmarksLes éléments de test qui font écho aux sorties de modèles gonflent les scoresTrès faible
Corpus de recherche documentaire pour RAGDes passages sûrs d’eux mais faux sont récupérés comme des faitsFaible pour les réponses à fort enjeu
Analyse de marché et socialeLes faux avis et messages faussent les comptages et le sentimentFaible

Pour l’entraînement, la préoccupation est bien documentée. Des recherches publiées ont montré que les modèles entraînés de manière répétée sur les sorties de modèles antérieurs perdent les parties les plus rares de la distribution de données originale, un échec décrit comme l’effondrement du modèle (model collapse). Pour l’analytique, la préoccupation est plus simple : une tendance de sentiment construite sur des avis générés mesure une campagne marketing, pas des clients. Ce problème est traité du côté de la collecte dans scraper les plateformes sociales pour l’analyse de sentiment.

Pourquoi un seul détecteur ne suffit pas

Les classificateurs de texte IA sont tentants car ils renvoient un score par document. En pratique, ils sont peu fiables dans exactement les conditions qui comptent pour les données web.

  • Les textes courts leur donnent trop peu de matière à travailler.
  • Le texte paraphrasé ou légèrement édité passe souvent pour humain.
  • Les langues autres que l’anglais sont généralement moins bien couvertes.
  • Certains écrits humains sont signalés bien trop souvent. Des études ont montré que les détecteurs classent à tort les écrits de personnes non natives anglophones comme générés par machine à des taux bien plus élevés.

Un grand laboratoire d’IA a retiré son propre classificateur de texte public en 2023, citant une faible précision. Traitez un score de classificateur comme une caractéristique faible parmi d’autres, jamais comme un verdict.

Des signaux qui fonctionnent mieux ensemble

Provenance et temps

Le signal individuel le plus fort ne se trouve pas dans le texte lui-même. C’est le moment où le contenu a été observé pour la première fois.

Les modèles de génération de texte sont devenus largement accessibles au public à la fin de 2022. Un contenu observé pour la première fois avant cette date est bien moins susceptible d’être généré par machine, quel que soit ce qu’en dit un classificateur. Un contenu observé pour la première fois après n’est pas automatiquement suspect, mais la probabilité a priori change.

Cela ne fonctionne que si vous enregistrez les moments d’observation. Stockez un horodatage de première observation pour chaque document dès la collecte, conservez-le à travers chaque copie et transformation, et réexplorez périodiquement pour pouvoir détecter les pages qui ont été discrètement réécrites plus tard. L’argument pour traiter le moment et le lieu d’une observation comme faisant partie des données est exposé dans la norme du point de vue d’observation.

Signaux au niveau de la source

Le contenu généré est généralement produit à grande échelle par un petit nombre d’opérateurs, ce qui rend les sources plus faciles à juger que les documents individuels. Évaluez les domaines et les sections, pas seulement les pages.

  • Vitesse de publication. Un domaine qui est passé de quelques pages par mois à des milliers par semaine.
  • Uniformité des modèles. De nombreuses pages partageant une seule structure et un seul schéma de titres, différant seulement par le sujet inséré.
  • Dispersion thématique. Un site unique couvrant des sujets sans lien avec une profondeur uniforme.
  • Absence de responsabilité. Aucune paternité, aucune page à propos, aucune coordonnée, ou des signatures inventées.
  • Densité de monétisation. Des pages qui existent principalement pour porter des liens d’affiliation ou des publicités.

Quasi-doublons et modèles

Les fermes de contenu tendent à produire de nombreuses paraphrases d’un même plan. La détection de quasi-doublons, typiquement le MinHash avec hachage sensible à la localité sur du texte découpé en shingles, regroupe ces variations. Un large groupe de pages quasi-identiques réparties sur de nombreux domaines est un signal fort de production de masse, et inspecter le groupe à la main est bien plus rapide que d’inspecter les pages une par une.

Conservez le HTML brut pour les sources que vous prévoyez d’analyser ainsi, car le modèle lui-même est souvent une signature plus claire que le texte.

Statistiques de document

Les propriétés statistiques du texte peuvent aider, à condition d’être traitées comme des preuves faibles. Une très faible perplexité sous un modèle de langue de référence, une faible variation dans la longueur et la structure des phrases, et un usage important de formulations génériques et vagues sont tous associés au texte généré.

Chacun de ces éléments est aussi courant dans certains écrits humains : documentation simple, brèves d’actualité formulaïques et texte de personnes non natives. Utilisez-les uniquement en combinaison, et calibrez-les par langue.

Filigranes, là où ils existent

Certains fournisseurs de modèles intègrent des filigranes statistiques dans le texte généré, et certains ont publié des outils de détection. Là où un filigrane est présent et détectable, c’est une preuve solide. Cela ne couvre que le texte des modèles participants, cela ne peut être vérifié qu’avec le détecteur du fournisseur, et la paraphrase ou la traduction l’affaiblit. Traitez un résultat positif comme significatif et un résultat négatif comme non informatif.

SignalForceFaiblesse principale
Date de première observationForte pour le contenu ancienNécessite des horodatages enregistrés à la collecte
Modèles au niveau de la sourceForte au niveau du domaineManque les pages générées ponctuelles sur de bons sites
Groupes de quasi-doublonsForte pour les fermes de contenuManque la génération originale et ponctuelle
Statistiques de documentFaible seulePénalise l’écriture simple et non native
Score de classificateurFaible seulPeu fiable sur du texte court, édité ou non anglophone
FiligraneForte en cas de positifAbsent de la plupart des textes

Des signaux à une politique de filtrage

Combinez les signaux en un score unique par document, avec les scores au niveau de la source alimentant les scores au niveau du document. Décidez ensuite quoi faire de chaque bande de score, et laissez la décision dépendre de l’objectif du jeu de données.

  • Conserver les documents dont le score est clairement humain ou qui ont été observés pour la première fois avant votre date limite.
  • Pondérer à la baisse les documents limites dans les mélanges de pré-entraînement plutôt que de les supprimer.
  • Mettre en quarantaine les documents probablement générés dans un stockage séparé, afin que la décision puisse être révisée lorsque le filtre s’améliore.
  • Supprimer uniquement lorsque l’usage l’exige, comme les jeux d’évaluation, où la contamination cause le plus de dégâts.

Versionnez le filtre, et enregistrez dans la documentation du jeu de données quelle version a produit quel sous-ensemble. Un filtre est un ensemble de décisions sur les données, et toute personne utilisant le jeu de données plus tard doit savoir quelles étaient ces décisions.

Toutes les données synthétiques ne sont pas indésirables. Les données d’entraînement délibérément générées ont des usages légitimes. Le problème est le contenu généré qui arrive non étiqueté et qui est confondu avec un écrit humain, donc lorsque vous produisez vous-même des données synthétiques, étiquetez-les à la source.

Mesurer le filtre, y compris ceux qu’il exclut à tort

Un filtre que personne n’a mesuré est une supposition.

Construisez un jeu de validation étiqueté à partir de votre propre exploration : des documents provenant de sources que vous savez rédigées par des humains, un échantillon que vous générez vous-même avec des modèles actuels dans vos langues cibles, et une tranche aléatoire de cas limites révisés à la main. Mesurez la précision et le rappel par langue et par domaine.

Auditez ensuite spécifiquement les faux positifs. Si le filtre supprime de manière disproportionnée les écrits de personnes non natives, la documentation technique simple ou certaines régions, il rétrécit discrètement le jeu de données d’une manière qui se manifestera plus tard comme un modèle qui sert moins bien ces utilisateurs. Le risque plus large d’un jeu de données déséquilibré est couvert dans votre pool de proxies résidentiels est un échantillon, pas l’internet.

Réexécutez l’évaluation régulièrement. Les générateurs s’améliorent, et un filtre qui fonctionnait le trimestre dernier peut se dégrader sans que personne ne le remarque.

Collecter pour que le filtrage soit possible

La plupart des signaux utiles dépendent de décisions prises au moment de la collecte.

  • Enregistrez les horodatages de première observation pour chaque document, et préservez-les à travers chaque transformation.
  • Stockez les métadonnées de source : domaine, section, date de publication lorsqu’elle est indiquée, et le point de vue depuis lequel la page a été observée.
  • Conservez les réponses brutes pour les sources que vous pourriez devoir analyser pour leurs modèles, et enregistrez-les avant l’analyse afin qu’un meilleur filtre puisse être rejoué sans recollecter. Le modèle est présenté dans transférer les données d’API de web scraping vers SQL.
  • Réexplorez selon un calendrier pour détecter les pages réécrites après la première collecte.
  • Privilégiez les sources humaines primaires : forums, sites régionaux, documentation et publications spécialisées, plutôt que les agrégateurs qui les recyclent.

Beaucoup des meilleures sources rédigées par des humains sont régionales et fortement protégées. Les atteindre depuis le bon pays, de manière suffisamment cohérente pour réexplorer, est là où l’infrastructure de collecte compte. Avec la passerelle Shifter, le marché est défini dans les identifiants contre p.shifter.io:443, et l’omission d’un identifiant de session fait tourner la sortie à chaque requête, ce qui convient aux récupérations de pages indépendantes :

customer-USERNAME-country-br:PASSWORD

Collectez de manière responsable : respectez les conditions de chaque site, maintenez des taux de requêtes proportionnés, et évitez de collecter des données personnelles dont vous n’avez pas besoin. Le cadre plus large est présenté dans proxies résidentiels éthiques pour la collecte de données IA.

FAQ

Le texte généré par IA peut-il être détecté de manière fiable ?

Pas de manière fiable pour des documents individuels. Des signaux combinés à travers les sources, les groupes et les horodatages fonctionnent bien mieux à l’échelle d’un jeu de données que n’importe quel classificateur par document.

Tout le contenu généré doit-il être retiré d’un jeu d’entraînement ?

Pas nécessairement. Pondérer à la baisse le contenu limite et étiqueter les données synthétiques intentionnelles est généralement préférable à une suppression agressive, qui retire aussi beaucoup d’écrits humains.

Le filtrage réduit-il la diversité du jeu de données ?

Cela peut être le cas, si le filtre pénalise l’écriture simple ou non native. Auditez les faux positifs par langue et par région avant d’appliquer un filtre à grande échelle.

Le contenu antérieur à fin 2022 peut-il être considéré comme sûrement rédigé par un humain ?

C’est une forte probabilité a priori, pas une garantie. Du contenu automatisé antérieur existait aussi. Combinez la date avec les autres signaux.

L’essentiel

Il n’existe pas d’interrupteur qui retire le contenu généré par IA d’un jeu de données web. Il existe un ensemble de signaux qui portent chacun une certaine preuve : quand le contenu a été observé pour la première fois, comment sa source se comporte, s’il appartient à un groupe de quasi-doublons, à quoi ressemblent ses statistiques, et occasionnellement un filigrane. Combinés, calibrés sur vos propres données et appliqués avec une politique adaptée à l’objectif du jeu de données, ils fonctionnent.

La plus grande partie de cela dépend de la collecte avec des horodatages, des métadonnées de source et des réponses brutes dès le départ. La vision produit se trouve sur la page collecte de données pour l’IA et l’apprentissage automatique, et le côté collecte est couvert dans collecter des données web pour l’entraînement de l’IA.

Prêt à commencer ?

Essayez les proxies résidentiels de Shifter, 205M+ IPs, 195+ pays, à partir de 0,75 $/GB.

Commencer