Cada rastreo web contiene ahora texto generado por máquinas: páginas de producto escritas por un modelo, artículos de granjas de contenido producidos por miles, reseñas y publicaciones de foros que ninguna persona escribió. Para muchos usos esto es inofensivo. Para datos de entrenamiento, conjuntos de evaluación y corpus de recuperación no lo es, y la proporción no deja de crecer.
El hecho incómodo es que ningún detector identifica de forma fiable texto generado documento por documento. Lo que funciona es un enfoque por capas: varias señales débiles combinadas, calibradas con tus propios datos y aplicadas con una política que se ajuste al propósito del conjunto de datos. Esta guía cubre las señales, cómo combinarlas y cómo recopilar datos para que el filtrado sea siquiera posible.
El proceso general para construir un conjunto de datos mediante scraping, incluida la deduplicación y la procedencia, está en cómo construir un conjunto de datos con web scraping. Esta guía se centra específicamente en el problema del contenido generado.
Por qué importa, según el caso de uso
| Uso del conjunto de datos | Riesgo del contenido generado | Tolerancia típica |
|---|---|---|
| Preentrenamiento de modelos | Estilo homogeneizado, errores amplificados, pérdida de conocimiento poco frecuente | Moderada, con reducción de peso |
| Evaluación y benchmarks | Elementos de prueba que reflejan salidas de modelos inflan las puntuaciones | Muy baja |
| Corpus de recuperación para RAG | Pasajes seguros pero incorrectos se recuperan como hechos | Baja para respuestas de alto riesgo |
| Analítica de mercado y social | Reseñas y publicaciones falsas distorsionan conteos y sentimiento | Baja |
Para el entrenamiento, la preocupación está bien documentada. Investigaciones publicadas han demostrado que los modelos entrenados repetidamente con la salida de modelos anteriores pierden las partes más raras de la distribución de datos original, un fallo descrito como colapso del modelo. Para la analítica, la preocupación es más simple: una tendencia de sentimiento construida sobre reseñas generadas mide una campaña de marketing, no a los clientes. Ese problema se aborda desde el lado de la recopilación en scraping de plataformas sociales para análisis de sentimiento.
Por qué un único detector no es suficiente
Los clasificadores de texto de IA resultan tentadores porque devuelven una puntuación por documento. En la práctica son poco fiables precisamente en las condiciones que importan para los datos web.
- Los textos cortos les dan muy poco con lo que trabajar.
- El texto parafraseado o ligeramente editado a menudo pasa por humano.
- Los idiomas distintos del inglés suelen estar peor cubiertos.
- Parte de la escritura humana se marca con demasiada frecuencia. Estudios han encontrado que los detectores clasifican erróneamente como generada por máquina la escritura de personas no nativas de inglés a tasas mucho más altas.
Un laboratorio de IA importante retiró su propio clasificador de texto público en 2023, citando una precisión baja. Trata la puntuación de un clasificador como una característica débil entre varias, nunca como un veredicto.
Señales que funcionan mejor juntas
Procedencia y tiempo
La señal individual más fuerte no está en el texto en absoluto. Es el momento en que se observó el contenido por primera vez.
Los modelos de texto generativo se pusieron ampliamente disponibles para el público a finales de 2022. Es mucho menos probable que el contenido observado por primera vez antes de esa fecha sea generado por máquinas, diga lo que diga un clasificador al respecto. El contenido visto por primera vez después no es automáticamente sospechoso, pero la probabilidad previa cambia.
Esto solo funciona si registras los momentos de observación. Guarda una marca de tiempo de primera observación para cada documento en el momento de la recopilación, consérvala en cada copia y transformación, y vuelve a rastrear periódicamente para poder detectar páginas que fueron reescritas silenciosamente más tarde. El argumento para tratar el cuándo y el dónde de una observación como parte de los datos se expone en el estándar de punto de observación.
Señales a nivel de fuente
El contenido generado suele producirse a escala por un pequeño número de operadores, lo que hace que las fuentes sean más fáciles de juzgar que los documentos individuales. Puntúa dominios y secciones, no solo páginas.
- Velocidad de publicación. Un dominio que pasó de unas pocas páginas al mes a miles a la semana.
- Uniformidad de plantilla. Muchas páginas que comparten una estructura y un patrón de encabezados, difiriendo solo en el tema insertado.
- Dispersión temática. Un único sitio que cubre temas no relacionados con una profundidad uniforme.
- Falta de responsabilidad. Sin autoría, sin página “sobre nosotros”, sin datos de contacto, o firmas inventadas.
- Densidad de monetización. Páginas que existen principalmente para albergar enlaces de afiliados o anuncios.
Casi duplicados y plantillas
Las granjas de contenido tienden a producir muchas paráfrasis del mismo esquema. La detección de casi duplicados, típicamente MinHash con hashing sensible a la localidad sobre texto segmentado en shingles, agrupa esas variaciones. Un gran clúster de páginas casi idénticas en muchos dominios es una señal fuerte de producción masiva, e inspeccionar el clúster a mano es mucho más rápido que inspeccionar las páginas una a una.
Conserva el HTML en bruto de las fuentes que esperas analizar de este modo, ya que la propia plantilla suele ser una firma más clara que el texto.
Estadísticas del documento
Las propiedades estadísticas del texto pueden ayudar, siempre que se traten como evidencia débil. Una perplejidad muy baja bajo un modelo de lenguaje de referencia, poca variación en la longitud y estructura de las frases, y un uso intenso de frases de relleno genéricas están todas asociadas con el texto generado.
Cada una de ellas también es habitual en cierta escritura humana: documentación sencilla, breves de noticias formularias y texto de escritores no nativos. Úsalas solo en combinación, y calíbralas por idioma.
Marcas de agua, donde existan
Algunos proveedores de modelos incrustan marcas de agua estadísticas en el texto generado, y algunos han publicado herramientas de detección. Cuando hay una marca de agua presente y detectable, es una evidencia fuerte. Solo cubre texto de los modelos participantes, solo puede comprobarse con el detector del proveedor, y el parafraseo o la traducción la debilitan. Trata un resultado positivo como significativo y uno negativo como poco informativo.
| Señal | Fortaleza | Principal debilidad |
|---|---|---|
| Fecha de primera observación | Fuerte para contenido antiguo | Necesita marcas de tiempo registradas en la recopilación |
| Patrones a nivel de fuente | Fuerte a nivel de dominio | No detecta páginas generadas puntuales en sitios buenos |
| Clústeres de casi duplicados | Fuerte para granjas de contenido | No detecta generación original y puntual |
| Estadísticas del documento | Débil por sí sola | Penaliza la escritura sencilla y no nativa |
| Puntuación del clasificador | Débil por sí sola | Poco fiable en texto corto, editado o no inglés |
| Marca de agua | Fuerte cuando es positiva | Ausente en la mayoría del texto |
De las señales a una política de filtrado
Combina las señales en una única puntuación por documento, con las puntuaciones a nivel de fuente alimentando las puntuaciones de los documentos. Después decide qué hacer con cada banda de puntuación, y deja que la decisión dependa del propósito del conjunto de datos.
- Conserva los documentos que puntúan claramente humanos o que fueron observados por primera vez antes de tu fecha de corte.
- Reduce el peso de los documentos límite en las mezclas de preentrenamiento en lugar de eliminarlos.
- Pon en cuarentena los documentos probablemente generados en un almacén separado, para poder revisar la decisión cuando el filtro mejore.
- Elimina solo cuando el caso de uso lo exija, como en los conjuntos de evaluación, donde la contaminación causa el mayor daño.
Versiona el filtro, y registra en la documentación del conjunto de datos qué versión produjo qué subconjunto. Un filtro es un conjunto de decisiones sobre los datos, y cualquiera que use el conjunto de datos más adelante necesita saber cuáles fueron esas decisiones.
No todos los datos sintéticos son indeseables. Los datos de entrenamiento generados deliberadamente tienen usos legítimos. El problema es el contenido generado que llega sin etiquetar y se confunde con escritura humana, así que cuando produzcas datos sintéticos tú mismo, etiquétalos desde el origen.
Mide el filtro, incluyendo a quién excluye erróneamente
Un filtro que nadie ha medido es una suposición.
Construye un conjunto de validación etiquetado a partir de tu propio rastreo: documentos de fuentes que sabes que están escritos por humanos, una muestra que tú mismo generas con modelos actuales en tus idiomas objetivo, y una porción aleatoria de casos límite revisados a mano. Mide la precisión y la exhaustividad por idioma y por dominio.
Después audita específicamente los falsos positivos. Si el filtro elimina desproporcionadamente la escritura de hablantes no nativos, la documentación técnica sencilla o regiones concretas, está estrechando silenciosamente el conjunto de datos de una forma que más tarde se manifestará como un modelo que sirve peor a esos usuarios. El riesgo más amplio de un conjunto de datos desequilibrado se aborda en tu pool de proxies residenciales es una muestra, no internet.
Vuelve a ejecutar la evaluación con regularidad. Los generadores mejoran, y un filtro que funcionaba el trimestre pasado puede degradarse sin que nadie se dé cuenta.
Recopila de forma que el filtrado sea posible
La mayoría de las señales útiles dependen de decisiones tomadas en el momento de la recopilación.
- Registra marcas de tiempo de primera observación para cada documento, y consérvalas en cada transformación.
- Guarda metadatos de la fuente: dominio, sección, fecha de publicación cuando se indique, y el punto de observación desde el que se vio la página.
- Conserva las respuestas en bruto de las fuentes que puedas necesitar analizar en busca de plantillas, y guárdalas antes del análisis para que un filtro mejor pueda reproducirse sin volver a recopilar. El patrón está en trasladar datos de una API de web scraping a SQL.
- Vuelve a rastrear según un calendario para detectar páginas reescritas después de la primera recopilación.
- Prefiere fuentes humanas primarias: foros, sitios regionales, documentación y publicaciones especializadas, en lugar de agregadores que las reciclan.
Muchas de las mejores fuentes escritas por humanos son regionales y están fuertemente defendidas. Alcanzarlas desde el país correcto, con la consistencia suficiente para volver a rastrearlas, es donde importa la infraestructura de recopilación. Con la puerta de enlace de Shifter, el mercado se fija en las credenciales frente a p.shifter.io:443, y omitir un identificador de sesión rota la salida por solicitud, lo que se adapta a las obtenciones de páginas independientes:
customer-USERNAME-country-br:PASSWORD
Recopila de forma responsable: respeta los términos de cada sitio, mantén las tasas de solicitud proporcionadas y evita recopilar datos personales que no necesitas. El planteamiento más amplio está en proxies residenciales éticos para la recopilación de datos de IA.
Preguntas frecuentes
¿Se puede detectar de forma fiable el texto generado por IA?
No de forma fiable para documentos individuales. Las señales combinadas a través de fuentes, clústeres y marcas de tiempo funcionan mucho mejor a escala de conjunto de datos que cualquier clasificador por documento.
¿Debe eliminarse todo el contenido generado de un conjunto de entrenamiento?
No necesariamente. Reducir el peso del contenido límite y etiquetar los datos sintéticos intencionados suele ser mejor que una eliminación agresiva, que también elimina mucha escritura humana.
¿El filtrado reduce la diversidad del conjunto de datos?
Puede hacerlo, si el filtro penaliza la escritura sencilla o no nativa. Audita los falsos positivos por idioma y región antes de aplicar un filtro a escala.
¿Es seguro tratar como escrito por humanos el contenido anterior a finales de 2022?
Es una probabilidad previa fuerte, no una garantía. También existía contenido automatizado anteriormente. Combina la fecha con las demás señales.
La conclusión
No existe un interruptor que elimine el contenido generado por IA de un conjunto de datos web. Existe un conjunto de señales que aportan cada una cierta evidencia: cuándo se observó el contenido por primera vez, cómo se comporta su fuente, si pertenece a un clúster de casi duplicados, qué aspecto tienen sus estadísticas, y ocasionalmente una marca de agua. Combinadas, calibradas con tus propios datos y aplicadas con una política que se ajuste al propósito del conjunto de datos, funcionan.
La mayor parte de esto depende de recopilar desde el principio con marcas de tiempo, metadatos de fuente y respuestas en bruto. La visión del producto está en la página de recopilación de datos para IA y aprendizaje automático, y el lado de la recopilación se aborda en recopilación de datos web para el entrenamiento de IA.