Un rastreo no es un corpus. Obtener miles de millones de páginas es un problema de infraestructura, y se trata en collecting web data for AI and LLM training. Convertir esas páginas en datos de entrenamiento que mejoren un modelo es un problema distinto, con sus propias etapas, y la mayor parte de la calidad del conjunto de datos final se decide ahí.
Esta guía recorre esas etapas en orden: decidir qué recopilar, respetar las exclusiones voluntarias, extraer texto, filtrar, deduplicar, eliminar la contaminación de evaluación y documentar el resultado. El pipeline general de conjuntos de datos obtenidos por scraping, a menor escala, está en how to build a dataset with web scraping.
Empieza por la mezcla, no por el rastreador
Decide qué necesita el modelo antes de decidir qué rastrear. Un corpus de entrenamiento es una mezcla: proporciones de idiomas, dominios, formatos y periodos de tiempo, expresadas como un presupuesto de tokens para cada uno.
Ese objetivo lo decide todo a continuación. Te indica de qué regiones recopilar, cuánto presupuesto de rastreo merece cada fuente y cuándo un dominio ya ha aportado suficiente. Sin él, un rastreo se desvía hacia lo que resulte más fácil de obtener, que suele ser sitios grandes, en inglés y con muchos enlaces, y el modelo hereda ese desequilibrio. El aspecto de muestreo de ese problema se trata en your residential proxy pool is a sample, not the internet.
La frontera de rastreo
La frontera es la cola de URLs pendientes de obtener, y la forma en que la gestiones decide qué partes de la web terminan en el corpus.
Semillas. Empieza con fuentes que coincidan con la mezcla: listas curadas de dominios por idioma y tema, sitemaps y enlaces desde páginas de alta calidad.
Priorización. Clasifica las URLs por valor esperado: una estimación de calidad previa para la fuente, la novedad respecto a lo que ya tienes y la actualidad cuando la recencia importa.
Canonicalización. Normaliza las URLs antes de encolarlas, eliminando parámetros de seguimiento, identificadores de sesión y rutas duplicadas, para que la misma página no se obtenga varias veces bajo direcciones distintas.
Presupuestos de cortesía. Limita la concurrencia y la tasa de peticiones por host, no solo de forma global. Una frontera que golpea con fuerza a un sitio pequeño es a la vez irresponsable y contraproducente, ya que termina bloqueada. Los detalles técnicos están en rate limiting and request throttling.
Política de re-rastreo. Decide con qué frecuencia se revisita cada fuente, en función de con qué frecuencia cambia y de cuánto contenido nuevo necesita la mezcla.
Respeta las exclusiones voluntarias en el momento de obtener
Las señales de exclusión voluntaria deben comprobarse cuando se obtiene una página y registrarse junto a ella, porque cambian con el tiempo y puede que necesites demostrar cuál era el estado.
- robots.txt, incluidas las reglas dirigidas a nombres de rastreadores específicos de IA.
- Señales a nivel de página, como las metaetiquetas robots y las cabeceras de respuesta.
- Reservas de derechos legibles por máquina. En la UE, los titulares de derechos pueden reservar los derechos de minería de texto y datos en formato legible por máquina, y se espera que los proveedores de modelos de IA de propósito general respeten esas reservas y documenten su contenido de entrenamiento.
- Términos del sitio que prohíban la recopilación o reutilización automatizada.
Almacena el estado de exclusión voluntaria junto con cada documento, y mantén la capacidad de eliminar documentos más adelante si una fuente retira el permiso. El planteamiento más amplio está en ethical residential proxies for AI data collection.
Extracción: de HTML a texto
El HTML en bruto no es, en su mayor parte, contenido. La navegación, los pies de página, los avisos de cookies, los widgets de artículos relacionados y los anuncios pueden superar en número al texto real de una página.
- Extrae el contenido principal y descarta el material de relleno.
- Conserva la estructura que aporta significado: encabezados, listas, tablas y bloques de código.
- Gestiona las páginas renderizadas. Parte del contenido solo existe después de ejecutar JavaScript; consulta when you need a web scraping API.
- Identifica el idioma por documento, y por párrafo en páginas multilingües, para que los objetivos de la mezcla puedan medirse de verdad.
Conserva las respuestas en bruto durante una ventana de repetición. La lógica de extracción mejorará, y volver a extraer a partir de las respuestas almacenadas es mucho más barato que volver a rastrear. El patrón de aterrizaje está en moving web scraping API data into SQL.
Filtrado de calidad
La mayor parte de lo que devuelve un rastreo no merece usarse para entrenar. El filtrado suele ejecutarse en capas, empezando por lo más económico.
Los filtros heurísticos eliminan lo obviamente inservible: documentos muy cortos, páginas dominadas por símbolos o números, líneas repetidas muchas veces, texto sin palabras funcionales habituales y páginas que son sobre todo listas de enlaces.
Los filtros de calidad basados en modelos puntúan los documentos frente a ejemplos del tipo de texto que quieres en mayor cantidad. Son potentes y codifican una definición de calidad, así que conviene comprobar qué excluyen sistemáticamente.
El filtrado de contenido generado importa cada año más, como se trata en how to detect and filter AI-generated content in web datasets.
Los filtros de seguridad aplican la política de contenido que requiera el modelo.
Calibra cada filtro por idioma. Un umbral ajustado para el inglés eliminará demasiado en algunos idiomas y demasiado poco en otros. Y mide qué elimina cada etapa, por idioma y dominio, para detectar un filtro que esté borrando silenciosamente la escritura de toda una región.
Deduplicación a escala de corpus
El texto duplicado está en todas partes en la web: artículos sindicados, sitios espejo, páginas basadas en plantillas y material de relleno repetido en un dominio. Si se deja, sobrepondera lo que más se haya copiado.
- Los duplicados exactos se eliminan aplicando hash al texto normalizado.
- Los casi duplicados se encuentran con MinHash y hashing sensible a la localidad sobre texto fragmentado en shingles, lo cual escala a corpus muy grandes.
- Los párrafos repetidos dentro de un dominio, como avisos legales y firmas, se eliminan a nivel de párrafo.
- Los duplicados a lo largo del tiempo, cuando la misma página aparece en varias instantáneas de rastreo, se colapsan en una sola versión.
Datos personales
Un rastreo web recopila datos personales quieras o no: nombres, direcciones de correo electrónico, números de teléfono y en ocasiones números de identificación. No recopiles desde detrás de inicios de sesión, elimina los patrones de identificadores comunes durante el procesamiento y documenta qué elimina el pipeline. El planteamiento legal está en residential proxies and GDPR compliance.
Descontaminación
Si tus benchmarks de evaluación aparecen en los datos de entrenamiento, tus evaluaciones dejan de medir nada. Las preguntas y respuestas de los benchmarks se copian por toda la web, así que la contaminación ocurre por defecto.
Comprueba el corpus buscando solapamiento con cada conjunto de evaluación que planees usar, normalmente mediante coincidencia de n-gramas largos, y elimina o marca las coincidencias. Registra qué benchmarks se comprobaron, para que los resultados posteriores puedan interpretarse con honestidad.
Documenta y versiona todo
Un corpus de entrenamiento es el producto de cientos de decisiones, y nadie puede usarlo de forma responsable sin conocerlas.
- Procedencia por documento: URL de origen, momento de obtención, el punto de observación desde el que se observó, estado de exclusión voluntaria y qué versiones de filtro superó.
- Una ficha de conjunto de datos que cubra fuentes, rango temporal, idiomas, filtros y sus versiones, lagunas conocidas y sesgos conocidos.
- Un pipeline reproducible, para que una versión del corpus pueda reconstruirse o modificarse cuando una fuente retire el permiso.
El argumento a favor de registrar dónde y cuándo se hizo cada observación se expone en the vantage-point standard.
La capa de recopilación a escala
La recopilación a gran escala necesita salidas distribuidas y geográficamente apropiadas, tanto para llegar a fuentes regionales como para mantener razonables las tasas de peticiones por host. Con la puerta de enlace Shifter, el mercado se fija en las credenciales frente a p.shifter.io:443, y omitir un identificador de sesión rota la salida en cada petición, lo cual conviene a una frontera que obtiene muchas páginas independientes:
customer-USERNAME-country-jp:PASSWORD
Por qué la capa de proxy importa específicamente para los datos de entrenamiento se trata en residential proxies for AI training data.
Métricas que mantienen la honestidad del corpus
| Métrica | Qué te indica |
|---|---|
| Tokens por idioma y dominio frente al objetivo | Si se está cumpliendo la mezcla |
| Tasa de eliminación por etapa de filtro, por idioma | Si un filtro está eliminando de más en algún sitio |
| Tasa de duplicados | Cuánto del rastreo fue repetición |
| Cobertura de exclusión voluntaria | Proporción de documentos con una comprobación de exclusión registrada |
| Coincidencias de contaminación por benchmark | Si se puede confiar en las evaluaciones |
Preguntas frecuentes
¿Podemos empezar a partir de un rastreo web público en lugar de rastrear nosotros mismos?
Los rastreos públicos son un buen punto de partida. Van por detrás de la web en vivo y tienen lagunas de cobertura, así que la mayoría de equipos añaden recopilación más específica y más reciente para los idiomas y dominios que les importan.
¿Con qué agresividad debe aplicarse el filtrado de calidad?
Lo suficientemente agresivo como para eliminar lo inservible, y medido con la suficiente atención como para ver qué más elimina. Auditar las eliminaciones por idioma y región antes de fijar los umbrales.
¿Es necesario seguir robots.txt para los datos de entrenamiento?
Sí, incluidas las reglas específicas para IA, y registrar el estado en el momento de la obtención. Las exclusiones voluntarias también se están convirtiendo en una expectativa legal en algunas jurisdicciones.
¿En qué se diferencia esto de los datos de grounding?
Los datos de entrenamiento moldean los pesos del modelo. Los datos de grounding se obtienen en el momento de la respuesta y se citan. Lo segundo se trata en grounding LLM agents with live web data.
La conclusión
Un corpus de entrenamiento a gran escala se construye en las etapas posteriores al rastreo: un objetivo de mezcla que decide qué recopilar, una frontera que se mantiene cortés, exclusiones voluntarias comprobadas y registradas en el momento de la obtención, una extracción limpia, un filtrado en capas calibrado por idioma, deduplicación en todos los niveles, descontaminación frente a las evaluaciones y una documentación que permite a cualquiera reconstruir las decisiones.
Recopila de las regiones que necesita la mezcla, conserva las respuestas en bruto para poder repetirlas y mide qué elimina cada etapa. La vista de producto está en la página residential proxies for AI and ML, con las tarifas en la página de precios.