Durante la mayor parte de sus treinta años de vida, robots.txt fue una cortesía: un archivo de texto plano que pedía a los rastreadores que se mantuvieran fuera de ciertas rutas, sin nada detrás salvo buenos modales. Eso ha cambiado. Se convirtió en un estándar formal de internet en 2022. En la UE, las señales de exclusión legibles por máquina determinan ahora si la minería de texto y datos es lícita, y los proveedores de modelos de IA tienen el deber legal de encontrarlas y respetarlas. Mientras tanto, ha surgido una serie de nuevas señales, cada una de las cuales afirma indicar qué permite un sitio que hagan los sistemas de IA con su contenido.
Para cualquiera que recopile datos web públicos, y especialmente para quien vea que sus datos acaban entrenando o alimentando modelos de IA, la pregunta práctica es sencilla: ¿cuáles de estas señales hay que leer, qué significan y qué se debe hacer con ellas? Esta guía expone el estado actual, a fecha de septiembre de 2026.
Conclusiones clave
- robots.txt es un estándar del IETF, RFC 9309. Define reglas de coincidencia precisas, pero establece con claridad que sus reglas “no son una forma de autorización de acceso”.
- En la UE, la excepción de minería de texto y datos con fines comerciales solo se aplica cuando los titulares de derechos no han reservado sus derechos “de manera adecuada, como por medios legibles por máquina” para el contenido en línea. Los tribunales alemanes han sostenido que dicha reserva solo es eficaz en forma legible por máquina.
- Los proveedores de modelos de IA de propósito general están obligados desde el 2 de agosto de 2025 a identificar y cumplir esas reservas. La facultad de la Comisión de imponerles multas se aplica desde el 2 de agosto de 2026.
- Existen nuevas señales de preferencia, desde Content Signals de Cloudflare hasta el vocabulario de preferencias de IA en borrador del IETF, pero ninguna es todavía un estándar terminado. Regístrelas incluso cuando no sean vinculantes.
- El uso de una red de proxies no cambia lo que un sitio ha solicitado. Las obligaciones se vinculan a lo que se recopila y cómo se usa, no a la dirección IP desde la que se recopila.
robots.txt ya es un estándar
El RFC 9309, publicado en septiembre de 2022, convirtió una convención de facto en un Estándar Propuesto. Varias de sus reglas sorprenden a quienes solo han leído archivos robots.txt a simple vista:
- Gana la regla más específica. “Debe usarse la coincidencia más específica encontrada”, medida por la longitud de la regla coincidente, y se prefiere
allowcuando una regla allow y una disallow son equivalentes. El orden en el archivo no importa. - La coincidencia de agente no distingue mayúsculas de minúsculas, y un rastreador sin un grupo coincidente recurre al grupo
*. - Los errores significan cosas distintas. Si robots.txt no está disponible, con una respuesta 4xx, un rastreador puede acceder a cualquier cosa. Si es inalcanzable por errores de servidor o de red, el rastreador “debe asumir la prohibición completa”.
- La caché está limitada. Los rastreadores “no deberían usar la versión en caché durante más de 24 horas, salvo que el archivo robots.txt sea inalcanzable”.
Y el límite más importante de todos: “Estas reglas no son una forma de autorización de acceso”. robots.txt no hace privado el contenido, e ignorarlo no equivale a irrumpir en un sistema. Lo que le da peso en algunos contextos es la ley, no el protocolo en sí.
Por qué importa legalmente en la UE
Las normas de derechos de autor de la UE permiten la minería de texto y datos de contenido lícitamente accesible, con dos excepciones distintas. Una cubre a las organizaciones de investigación y a las instituciones de patrimonio cultural que realizan investigación científica, y no admite exclusión. La otra cubre a todos los demás, incluida la minería comercial, pero solo se aplica cuando el uso “no ha sido reservado expresamente por sus titulares de derechos de manera adecuada, como por medios legibles por máquina en el caso de contenido puesto a disposición del público en línea”.
La Ley de IA aplica después esa regla a la IA. Los proveedores de modelos de IA de propósito general deben “implantar una política para cumplir el Derecho de la Unión en materia de derechos de autor y derechos afines, y en particular para identificar y cumplir, incluso mediante tecnologías punteras, una reserva de derechos” formulada conforme a las normas de derechos de autor. Esas obligaciones se aplican desde el 2 de agosto de 2025. Las facultades sancionadoras de la Comisión sobre los proveedores de IA de propósito general, de hasta el 3% de la facturación mundial, se aplican desde el 2 de agosto de 2026, y los modelos puestos en el mercado antes de agosto de 2025 tienen hasta el 2 de agosto de 2027 para cumplir.
El Código de Buenas Prácticas voluntario para la IA de Propósito General, publicado en julio de 2025, concreta esto. Los signatarios se comprometen “a emplear rastreadores web que lean y sigan las instrucciones expresadas conforme al Protocolo de Exclusión de Robots (robots.txt), según se especifica en” el RFC 9309, y a identificar y cumplir otros protocolos legibles por máquina apropiados. Cabe destacar dos matices del Código. La adhesión “no constituye el cumplimiento del Derecho de la Unión en materia de derechos de autor y derechos afines”. Y el compromiso no afecta a la forma en que se aplican los derechos de autor al contenido “extraído o rastreado de internet por terceros” y usado por los signatarios. Comprar un conjunto de datos no elimina las reservas que se aplicaban a sus fuentes.
Lo que han dicho los tribunales
La jurisprudencia todavía se está formando, y dos sentencias ilustran la dirección.
En Alemania, un fotógrafo demandó a la organización sin ánimo de lucro LAION por el uso de su imagen en un conjunto de datos de entrenamiento de IA. Los tribunales de Hamburgo desestimaron la demanda. En apelación, el Tribunal Regional Superior sostuvo, en palabras del resumen del Tribunal Federal de Justicia, que una reserva sobre obras en línea solo es eficaz “in maschinenlesbarer Form”, en forma legible por máquina, y que el demandante no había demostrado que su reserva, redactada en lenguaje natural en las condiciones de uso, fuera legible por máquina en el momento relevante. El Tribunal Federal de Justicia oyó el recurso de apelación adicional el 3 de septiembre de 2026 y ha fijado su decisión para el 17 de diciembre de 2026.
En los Países Bajos, un tribunal de Ámsterdam dictó sentencia el 30 de octubre de 2024 en un litigio entre editores de periódicos y un agregador de noticias. El agregador argumentó, y los editores no lo discutieron, que su robots.txt excluía solo a determinados bots de IA, como GPTBot, ChatGPT-User y CCBot. Eso no bastaba para establecer que los derechos se habían reservado de forma adecuada y legible por máquina frente al uso del agregador, de modo que se aplicaba la excepción.
Ambas apuntan en la misma dirección: lo que cuenta son las señales legibles por máquina, y una señal dirigida a bots concretos puede no reservar derechos frente a todos los demás. Ninguna de las dos es una orientación definitiva, y ambas dependen de los hechos. Consulte cuestiones concretas con un asesor legal.
Las señales que se va a encontrar
| Señal | Dónde se encuentra | Estado | Qué expresa |
|---|---|---|---|
| Allow y Disallow de robots.txt | /robots.txt | Estándar del IETF, RFC 9309 | Si un rastreador determinado puede acceder a una ruta |
| Content Signals | Líneas en robots.txt, como Content-Signal: search=yes, ai-train=no | Política de Cloudflare, publicada en septiembre de 2025 | Preferencias para búsqueda, entrada de IA y entrenamiento de IA |
| Preferencias de IA (Content-Usage) | Líneas en robots.txt o una cabecera HTTP, como Content-Usage: train-ai=n | Borradores del grupo de trabajo del IETF, aún no son estándares | Preferencias para entrenamiento de IA, uso de IA y búsqueda |
| TDMRep | /.well-known/tdmrep.json, una cabecera HTTP tdm-reservation o metaetiqueta HTML | Informe del Grupo Comunitario del W3C, no es un Estándar del W3C | Si se reservan los derechos de minería de texto y datos |
| Condiciones de servicio | Las páginas legales del sitio | Contrato y, en la UE, posiblemente una reserva si es legible por máquina | Lo que digan las condiciones del sitio |
Dos detalles importan. Los Content Signals de Cloudflare definen search, ai-input (para recuperación, fundamentación y respuestas generadas) y ai-train, y la política establece que “las señales de contenido expresan preferencias; no son contramedidas técnicas contra el scraping”. También declara que las restricciones expresadas mediante las señales constituyen reservas expresas de derechos conforme a las normas de derechos de autor de la UE. Los borradores del IETF, por su parte, están realmente inacabados: el borrador de vocabulario actual lleva una nota indicando que su contenido “NO REFLEJA CONSENSO del Grupo de Trabajo”. Cabe esperar que las etiquetas cambien.
Cómo tratan estas señales los principales rastreadores de IA
Los operadores publican sus propias reglas, y difieren, especialmente en el caso de las peticiones hechas en nombre de un usuario.
| Operador | Agente | Qué hace el bloqueo, según el operador |
|---|---|---|
| OpenAI | GPTBot | Indica que el contenido “no debería usarse para entrenar modelos base de IA generativa” |
| OpenAI | OAI-SearchBot | El sitio no aparece en las respuestas de búsqueda de ChatGPT, aunque puede seguir apareciendo como enlaces de navegación |
| OpenAI | ChatGPT-User | Iniciado por el usuario; “es posible que las reglas de robots.txt no se apliquen” |
| Google-Extended | Un token de robots.txt sin agente de usuario propio; controla el uso para entrenar y fundamentar los modelos Gemini, y “no afecta a la inclusión de un sitio en Google Search” | |
| Rastreadores activados por el usuario | ”generalmente ignoran las reglas de robots.txt” | |
| Anthropic | ClaudeBot, Claude-User, Claude-SearchBot | Bloquear ClaudeBot excluye el contenido futuro del entrenamiento; bloquear Claude-User impide la recuperación para consultas de usuario; los bots respetan robots.txt y crawl-delay |
Para un equipo de datos, la lección es que “bloquear la IA” no es un único interruptor. Un sitio puede permitir la indexación en buscadores mientras rechaza el entrenamiento, o rechazar el entrenamiento mientras sigue siendo consultado en vivo cuando un usuario pregunta por él. Lea las señales según el uso que realmente vaya a hacer.
Cuántos sitios se excluyen
Las exclusiones han crecido con rapidez. El estudio “Consent in Crisis” de la Data Provenance Initiative, una auditoría de 14.000 dominios web publicada en julio de 2024, encontró que en un solo año las restricciones de robots.txt dejaron “totalmente restringido en torno al 5%+ de todos los tokens de C4, o el 28%+ de las fuentes de C4 más activamente mantenidas y críticas”, y que “en cuanto a las restricciones de rastreo por Condiciones de Servicio, un pleno 45% de C4 está ahora restringido”. La cobertura es desigual en la parte alta de la web, sin embargo: Cloudflare informó en julio de 2025 de que “solo alrededor del 37% de los 10.000 dominios principales tiene actualmente un archivo robots.txt”, y que GPTBot estaba prohibido en el 7,8% de esos archivos.
Qué debería hacer un recopilador responsable
Entrene o no modelos, una política clara le protege a usted y a los sitios de los que depende.
- Obtenga y respete robots.txt correctamente. Guárdelo en caché durante no más de 24 horas, trate los errores de servidor como “prohibir todo” y aplique las reglas al estilo del RFC 9309.
- Conozca su finalidad. La indexación, la recuperación para respuestas en vivo y el entrenamiento de modelos son usos distintos, y las señales más nuevas los tratan de forma diferente. Decida a cuál sirve su recopilación y lea las señales para ese uso.
- Registre las señales junto con los datos. Almacene las reglas de robots.txt, las señales de contenido y las cabeceras TDMRep que se aplicaban en el momento de la recopilación junto a cada registro. Si un conjunto de datos se usa más adelante para IA, ese registro es la forma de demostrar que las reservas fueron identificadas. Pertenece al mismo registro de procedencia que el punto de vista y el momento de captura.
- Evalúe las condiciones de servicio con asesoría legal. Pueden importar contractualmente en todas partes, y en la UE pueden contar como una reserva si se expresan de forma legible por máquina.
- Regule el ritmo de su recopilación. Respetar los límites de rastreo y reducir la velocidad bajo carga forma parte de la misma buena fe, como se explica en limitación de tasa y regulación de peticiones.
Una advertencia sobre las herramientas: el urllib.robotparser integrado de Python aplica las reglas en el orden del archivo en lugar de por la coincidencia más específica. Dado Disallow: /shop seguido de Allow: /shop/public, informa de que /shop/public/item está prohibido; si se intercambian las dos líneas, dice que está permitido. El RFC 9309 dice que está permitido en ambos casos. Un pequeño verificador que sigue el RFC, y registra las líneas de preferencia de IA que encuentra, tiene este aspecto:
import re
import urllib.error
import urllib.request
def _groups(text):
"""Parse robots.txt into (agents, rules, extras) groups, following RFC 9309 grouping."""
groups, agents, rules, extras, last = [], [], [], [], None
for raw in text.splitlines():
line = raw.split("#", 1)[0].strip()
if ":" not in line:
continue
key, value = (p.strip() for p in line.split(":", 1))
key = key.lower()
if key == "user-agent":
if last != "user-agent" and agents:
groups.append((agents, rules, extras))
agents, rules, extras = [], [], []
agents.append(value.lower())
elif key in ("allow", "disallow") and agents:
rules.append((key, value))
elif key in ("content-signal", "content-usage") and agents:
extras.append((key, value))
last = key
if agents:
groups.append((agents, rules, extras))
return groups
def _pattern(path):
regex = re.escape(path).replace(r"\*", ".*")
return re.compile(regex[:-2] + "$" if regex.endswith(r"\$") else regex)
def check(robots_txt, user_agent, path):
"""Allow/disallow per RFC 9309 (most specific match wins, allow on ties), plus AI signals."""
token = user_agent.lower()
groups = _groups(robots_txt)
matched = [g for g in groups if token in g[0]] or [g for g in groups if "*" in g[0]]
rules = [r for g in matched for r in g[1]]
extras = [e for g in matched for e in g[2]]
best = None
for kind, value in rules:
if value and _pattern(value).match(path):
length = len(value)
if best is None or length > best[1] or (length == best[1] and kind == "allow"):
best = (kind, length)
return {"allowed": best is None or best[0] == "allow", "signals": extras}
def fetch_robots(origin, opener=None):
"""Fetch robots.txt. Per RFC 9309: 4xx means no rules; 5xx or network failure means disallow all."""
opener = opener or urllib.request.build_opener()
try:
with opener.open(origin.rstrip("/") + "/robots.txt", timeout=30) as r:
return r.read(512 * 1024).decode("utf-8", "replace")
except urllib.error.HTTPError as e:
return "" if 400 <= e.code < 500 else "User-agent: *\nDisallow: /"
except OSError:
return "User-agent: *\nDisallow: /"
Es deliberadamente pequeño. Los rastreadores de producción deberían también comprobar las cabeceras TDMRep y el archivo /.well-known/tdmrep.json cuando el entrenamiento esté dentro del alcance, y conservar una copia fechada de cada robots.txt en el que se hayan basado.
Dónde encajan los proxies
Los proxies residenciales cambian de dónde parece proceder una petición. No cambian lo que un sitio le ha pedido, ni cambian sus obligaciones conforme al derecho de autor o a las condiciones de un sitio. Las normas de la UE se vinculan al uso del contenido, y el Código de Buenas Prácticas mantiene explícitamente dentro de su alcance la recopilación por terceros. Use una red de proxies para ver la web como la ven los usuarios reales en un mercado determinado, para repartir la carga con corrección y para medir con honestidad, y aplique las mismas comprobaciones de robots.txt y de reservas que aplicaría desde sus propios servidores. El argumento más amplio se desarrolla en proxies residenciales éticos para la recopilación de datos de IA.
En definitiva
robots.txt ha madurado. Es un estándar con reglas precisas, y en la UE, las reservas legibles por máquina construidas sobre él y junto a él determinan ahora si la minería de texto y datos está permitida, con los proveedores de IA sujetos a un deber legal directo de respetarlas y con multas disponibles a partir de agosto de 2026. Las nuevas señales para búsqueda, entrada de IA y entrenamiento se están extendiendo con rapidez, aunque los estándares que las sustentan estén inacabados.
Para un equipo de datos, la política viable es la misma con independencia de cómo se resuelvan los detalles: analice robots.txt correctamente, sepa a qué uso sirve su recopilación, registre cada señal que se aplicaba en el momento de la recopilación, y trate las preferencias por las que no está estrictamente obligado como información que merece conservarse, no como ruido que descartar. Los equipos que hagan esto ahora no tendrán que reconstruirlo más tarde.
Fuentes y referencias
- IETF, RFC 9309: Robots Exclusion Protocol, septiembre de 2022.
- Directiva (UE) 2019/790 sobre los derechos de autor y derechos afines en el mercado único digital. Excepciones de minería de texto y datos.
- Reglamento (UE) 2024/1689, la Ley de IA. Obligaciones para los proveedores de modelos de IA de propósito general y fechas de aplicación.
- Comisión Europea, Código de Buenas Prácticas para la IA de Propósito General, publicado el 10 de julio de 2025, capítulo sobre derechos de autor.
- Bundesgerichtshof, nota de prensa 085/2026 sobre I ZR 281/25, y fechas de vista y decisión.
- Rechtbank Amsterdam, sentencia de 30 de octubre de 2024, ECLI:NL:RBAMS:2024:6563.
- Grupo de trabajo AI Preferences del IETF, draft-ietf-aipref-vocab y draft-ietf-aipref-attach.
- Grupo Comunitario del W3C, TDM Reservation Protocol, 10 de mayo de 2024.
- Blog de Cloudflare, Content Signals Policy, 24 de septiembre de 2025, y Reid Tatoris, sobre el control del uso de contenido para entrenamiento de IA, 1 de julio de 2025.
- OpenAI, Resumen de los rastreadores de OpenAI; Google, rastreadores comunes y rastreadores activados por el usuario; Anthropic, artículo de ayuda sobre rastreadores.
- Longpre et al., Consent in Crisis: The Rapid Decline of the AI Data Commons, julio de 2024.
Este artículo es información general, no asesoramiento legal. Consulte a un asesor legal sobre sus obligaciones en cada jurisdicción.