Durante a maior parte de seus trinta anos de existência, o robots.txt foi uma cortesia: um arquivo de texto simples pedindo aos crawlers que ficassem fora de determinados caminhos, sem nada por trás além de boas maneiras. Isso mudou. Ele se tornou um padrão formal da internet em 2022. Na UE, os opt-outs legíveis por máquina agora decidem se a mineração de texto e dados é lícita, e os provedores de modelos de IA têm o dever legal de encontrá-los e respeitá-los. Enquanto isso, surgiu uma safra de novos sinais, cada um alegando dizer o que um site permite que sistemas de IA façam com seu conteúdo.
Para quem coleta dados públicos da web, e especialmente para quem tem seus dados usados no treinamento ou na alimentação de modelos de IA, a questão prática é simples: quais desses sinais você precisa ler, o que eles significam e o que você deve fazer a respeito? Este guia apresenta o estado atual, em setembro de 2026.
Principais conclusões
- O robots.txt é um padrão do IETF, a RFC 9309. Ele define regras precisas de correspondência, mas afirma claramente que suas regras “não são uma forma de autorização de acesso.”
- Na UE, a exceção comercial de mineração de texto e dados se aplica apenas quando os titulares de direitos não reservaram seus direitos “de maneira apropriada, como por meios legíveis por máquina” para conteúdo online. Tribunais alemães entenderam que essa reserva só é eficaz em formato legível por máquina.
- Os provedores de modelos de IA de propósito geral são obrigados, desde 2 de agosto de 2025, a identificar e cumprir essas reservas. O poder da Comissão de multá-los se aplica a partir de 2 de agosto de 2026.
- Existem novos sinais de preferência, do Content Signals da Cloudflare ao rascunho de vocabulário de preferências de IA do IETF, mas nenhum deles ainda é um padrão finalizado. Registre-os mesmo quando não forem vinculantes.
- Usar uma rede de proxies não muda o que um site pediu. As obrigações se vinculam ao que você coleta e a como você usa, não ao endereço IP a partir do qual você coleta.
O robots.txt agora é um padrão
A RFC 9309, publicada em setembro de 2022, transformou uma convenção de fato em um Proposed Standard. Várias de suas regras surpreendem quem só leu arquivos robots.txt a olho nu:
- A regra mais específica vence. “A correspondência mais específica encontrada DEVE ser usada”, medida pelo comprimento da regra correspondente, com
allowpreferido quando uma regra de allow e uma de disallow forem equivalentes. A ordem no arquivo não importa. - A correspondência de agente não diferencia maiúsculas de minúsculas, e um crawler sem grupo correspondente recorre ao grupo
*. - Erros significam coisas diferentes. Se o robots.txt estiver indisponível, com uma resposta 4xx, um crawler pode acessar qualquer coisa. Se estiver inacessível devido a erros de servidor ou de rede, o crawler “DEVE presumir bloqueio total.”
- O cache é limitado. Os crawlers “NÃO DEVEM usar a versão em cache por mais de 24 horas, a menos que o arquivo robots.txt esteja inacessível.”
E o limite mais importante: “Essas regras não são uma forma de autorização de acesso.” O robots.txt não torna o conteúdo privado, e ignorá-lo não é o mesmo que invadir um sistema. O que lhe dá peso em alguns contextos é a lei, não o protocolo em si.
Por que isso importa juridicamente na UE
As regras de direitos autorais da UE permitem a mineração de texto e dados de conteúdo licitamente acessível, com duas exceções diferentes. Uma cobre organizações de pesquisa e instituições de patrimônio cultural que realizam pesquisa científica, e não tem opt-out. A outra cobre todos os demais, incluindo a mineração comercial, mas se aplica apenas quando o uso “não tiver sido expressamente reservado por seus titulares de direitos de maneira apropriada, como por meios legíveis por máquina, no caso de conteúdo disponibilizado publicamente online.”
O AI Act então aplica essa regra à IA. Os provedores de modelos de IA de propósito geral devem “implementar uma política para cumprir a legislação da União sobre direitos autorais e direitos conexos e, em particular, identificar e cumprir, inclusive por meio de tecnologias de ponta, uma reserva de direitos” feita nos termos das regras de direitos autorais. Essas obrigações se aplicam desde 2 de agosto de 2025. Os poderes de multa da Comissão sobre os provedores de IA de propósito geral, de até 3% do faturamento mundial, se aplicam a partir de 2 de agosto de 2026, e os modelos colocados no mercado antes de agosto de 2025 têm até 2 de agosto de 2027 para se adequar.
O voluntário General-Purpose AI Code of Practice, publicado em julho de 2025, torna isso concreto. Os signatários se comprometem “a empregar web crawlers que leiam e sigam instruções expressas de acordo com o Robot Exclusion Protocol (robots.txt), conforme especificado na” RFC 9309, e a identificar e cumprir outros protocolos apropriados legíveis por máquina. Duas ressalvas do Código merecem atenção. A adesão “não constitui conformidade com a legislação da União sobre direitos autorais e direitos conexos.” E o compromisso não afeta a forma como os direitos autorais se aplicam a conteúdo “extraído ou rastreado da internet por terceiros” e usado pelos signatários. Comprar um conjunto de dados não legitima as reservas que se aplicavam às suas fontes.
O que os tribunais disseram
A jurisprudência ainda está se formando, e duas decisões ilustram a direção.
Na Alemanha, um fotógrafo processou a organização sem fins lucrativos LAION pelo uso de sua imagem em um conjunto de dados de treinamento de IA. Os tribunais de Hamburgo rejeitaram a ação. Em recurso, o Tribunal Regional Superior entendeu, nas palavras do resumo do Tribunal Federal de Justiça, que uma reserva para obras online só é eficaz “in maschinenlesbarer Form”, ou seja, em formato legível por máquina, e que o autor da ação não havia demonstrado que sua reserva, redigida em linguagem natural nos termos de uso, era legível por máquina no momento relevante. O Tribunal Federal de Justiça analisou o recurso adicional em 3 de setembro de 2026 e agendou sua decisão para 17 de dezembro de 2026.
Nos Países Baixos, um tribunal de Amsterdã decidiu, em 30 de outubro de 2024, uma disputa entre editoras de jornais e um agregador de notícias. O agregador argumentou, e as editoras não contestaram, que seu robots.txt excluía apenas determinados bots de IA, como GPTBot, ChatGPT-User e CCBot. Isso não foi suficiente para estabelecer que os direitos haviam sido reservados de maneira apropriada e legível por máquina para o uso do agregador, de modo que a exceção se aplicou.
Ambas apontam na mesma direção: o que conta são os sinais legíveis por máquina, e um sinal direcionado a bots específicos pode não reservar direitos contra todos os demais. Nenhuma das duas é uma orientação definitiva, e ambas dependem dos fatos. Leve questões específicas a um advogado.
Os sinais que você vai encontrar
| Signal | Where it lives | Status | What it expresses |
|---|---|---|---|
| robots.txt Allow e Disallow | /robots.txt | Padrão do IETF, RFC 9309 | Se um crawler nomeado pode acessar um caminho |
| Content Signals | Linhas no robots.txt, como Content-Signal: search=yes, ai-train=no | Política da Cloudflare, publicada em setembro de 2025 | Preferências para busca, entrada de IA e treinamento de IA |
| Preferências de IA (Content-Usage) | Linhas no robots.txt ou um cabeçalho HTTP, como Content-Usage: train-ai=n | Rascunhos do grupo de trabalho do IETF, ainda não são padrões | Preferências para treinamento de IA, uso de IA e busca |
| TDMRep | /.well-known/tdmrep.json, um cabeçalho HTTP tdm-reservation ou meta tag HTML | Relatório do W3C Community Group, não é um W3C Standard | Se os direitos de mineração de texto e dados estão reservados |
| Termos de serviço | As páginas legais do site | Contrato e, na UE, possivelmente uma reserva se for legível por máquina | O que quer que os termos do site digam |
Dois detalhes importam. O Content Signals da Cloudflare define search, ai-input (para recuperação, embasamento e respostas geradas) e ai-train, e a política declara que “os content signals expressam preferências; não são contramedidas técnicas contra scraping.” Ela também declara que as restrições expressas por meio dos sinais são reservas expressas de direitos nos termos das regras de direitos autorais da UE. Os rascunhos do IETF, por sua vez, são genuinamente inacabados: o rascunho atual de vocabulário traz uma nota de que seu conteúdo “NÃO REFLETE O CONSENSO do Working Group”. Espere que os rótulos mudem.
Como os principais crawlers de IA os tratam
Os operadores publicam suas próprias regras, e elas diferem, especialmente para buscas feitas em nome de um usuário.
| Operator | Agent | What blocking it does, per the operator |
|---|---|---|
| OpenAI | GPTBot | Indica que o conteúdo “não deve ser usado no treinamento de modelos de fundação de IA generativa” |
| OpenAI | OAI-SearchBot | O site não aparece nas respostas de busca do ChatGPT, embora ainda possa aparecer como links de navegação |
| OpenAI | ChatGPT-User | Iniciado pelo usuário; “as regras do robots.txt podem não se aplicar” |
| Google-Extended | Um token de robots.txt sem user agent próprio; controla o uso para treinamento e embasamento dos modelos Gemini, e “não afeta a inclusão de um site no Google Search” | |
| User-triggered fetchers | ”geralmente ignoram as regras do robots.txt” | |
| Anthropic | ClaudeBot, Claude-User, Claude-SearchBot | Bloquear o ClaudeBot exclui conteúdo futuro do treinamento; bloquear o Claude-User impede a recuperação para consultas de usuários; os bots respeitam o robots.txt e o crawl-delay |
Para uma equipe de dados, a lição é que “bloquear IA” não é um único interruptor. Um site pode permitir a indexação para busca e ao mesmo tempo recusar o treinamento, ou recusar o treinamento e ainda assim ser buscado ao vivo quando um usuário pergunta sobre ele. Leia os sinais para o uso que você realmente faz.
Quantos sites optam por sair
Os opt-outs cresceram rapidamente. O estudo “Consent in Crisis” da Data Provenance Initiative, uma auditoria de 14.000 domínios web publicada em julho de 2024, constatou que, em um único ano, as restrições do robots.txt tornaram “totalmente restritos ~5%+ de todos os tokens do C4, ou 28%+ das fontes críticas mais ativamente mantidas do C4”, e que “quanto às restrições de rastreamento nos Termos de Serviço, 45% do C4 já está restrito.” A cobertura é desigual no topo da web, porém: a Cloudflare relatou em julho de 2025 que “apenas cerca de 37% dos 10.000 principais domínios atualmente têm um arquivo robots.txt”, e que o GPTBot era proibido em 7.8% desses arquivos.
O que um coletor responsável deve fazer
Independentemente de você treinar modelos ou não, uma política clara protege você e os sites dos quais você depende.
- Busque e obedeça o robots.txt corretamente. Armazene-o em cache por no máximo 24 horas, trate erros de servidor como “bloquear tudo” e faça a correspondência de regras conforme a RFC 9309.
- Conheça seu propósito. Indexação, recuperação para respostas ao vivo e treinamento de modelos são usos diferentes, e os sinais mais recentes os tratam de forma diferente. Decida a qual deles sua coleta serve e leia os sinais para esse uso.
- Registre os sinais junto com os dados. Armazene as regras de robots.txt, os content signals e os cabeçalhos TDMRep que se aplicavam no momento da coleta junto com cada registro. Se um conjunto de dados for usado depois para IA, esse registro é como você demonstra que as reservas foram identificadas. Ele pertence ao mesmo registro de proveniência que o ponto de vista e o horário de captura.
- Avalie os termos de serviço com um advogado. Eles podem importar contratualmente em qualquer lugar, e na UE podem contar como uma reserva se expressos de maneira legível por máquina.
- Ajuste o ritmo da sua coleta. Respeitar limites de rastreamento e reduzir a atividade sob carga faz parte dessa mesma boa-fé, conforme abordado em limitação de taxa e controle de requisições.
Um alerta sobre ferramentas: o urllib.robotparser, embutido no Python, aplica as regras na ordem do arquivo, e não pela correspondência mais específica. Dado Disallow: /shop seguido de Allow: /shop/public, ele indica /shop/public/item como bloqueado; inverta as duas linhas e ele diz que é permitido. A RFC 9309 diz que é permitido nos dois casos. Um pequeno verificador que segue a RFC, e registra as linhas de preferência de IA que encontra, se parece com isto:
import re
import urllib.error
import urllib.request
def _groups(text):
"""Parse robots.txt into (agents, rules, extras) groups, following RFC 9309 grouping."""
groups, agents, rules, extras, last = [], [], [], [], None
for raw in text.splitlines():
line = raw.split("#", 1)[0].strip()
if ":" not in line:
continue
key, value = (p.strip() for p in line.split(":", 1))
key = key.lower()
if key == "user-agent":
if last != "user-agent" and agents:
groups.append((agents, rules, extras))
agents, rules, extras = [], [], []
agents.append(value.lower())
elif key in ("allow", "disallow") and agents:
rules.append((key, value))
elif key in ("content-signal", "content-usage") and agents:
extras.append((key, value))
last = key
if agents:
groups.append((agents, rules, extras))
return groups
def _pattern(path):
regex = re.escape(path).replace(r"\*", ".*")
return re.compile(regex[:-2] + "$" if regex.endswith(r"\$") else regex)
def check(robots_txt, user_agent, path):
"""Allow/disallow per RFC 9309 (most specific match wins, allow on ties), plus AI signals."""
token = user_agent.lower()
groups = _groups(robots_txt)
matched = [g for g in groups if token in g[0]] or [g for g in groups if "*" in g[0]]
rules = [r for g in matched for r in g[1]]
extras = [e for g in matched for e in g[2]]
best = None
for kind, value in rules:
if value and _pattern(value).match(path):
length = len(value)
if best is None or length > best[1] or (length == best[1] and kind == "allow"):
best = (kind, length)
return {"allowed": best is None or best[0] == "allow", "signals": extras}
def fetch_robots(origin, opener=None):
"""Fetch robots.txt. Per RFC 9309: 4xx means no rules; 5xx or network failure means disallow all."""
opener = opener or urllib.request.build_opener()
try:
with opener.open(origin.rstrip("/") + "/robots.txt", timeout=30) as r:
return r.read(512 * 1024).decode("utf-8", "replace")
except urllib.error.HTTPError as e:
return "" if 400 <= e.code < 500 else "User-agent: *\nDisallow: /"
except OSError:
return "User-agent: *\nDisallow: /"
Ele é propositalmente pequeno. Crawlers de produção também deveriam verificar os cabeçalhos TDMRep e o arquivo /.well-known/tdmrep.json quando o treinamento estiver no escopo, e manter uma cópia datada de cada robots.txt em que se basearam.
Onde os proxies se encaixam
Os proxies residenciais mudam de onde uma requisição parece vir. Eles não mudam o que um site pediu a você, nem mudam suas obrigações sob a lei de direitos autorais ou os termos de um site. As regras da UE se vinculam ao uso do conteúdo, e o Code of Practice mantém explicitamente a coleta por terceiros dentro do escopo. Use uma rede de proxies para ver a web como usuários reais em um determinado mercado a veem, para distribuir a carga com educação e medir com honestidade, e aplique as mesmas verificações de robots.txt e de reserva que você aplicaria a partir de seus próprios servidores. O argumento mais amplo é apresentado em proxies residenciais éticos para coleta de dados de IA.
Conclusão
O robots.txt amadureceu. É um padrão com regras precisas, e na UE, reservas legíveis por máquina construídas sobre ele e ao seu lado agora decidem se a mineração de texto e dados é permitida, com os provedores de IA sob o dever legal direto de respeitá-las e multas disponíveis a partir de agosto de 2026. Novos sinais para busca, entrada de IA e treinamento estão se espalhando rapidamente, ainda que os padrões por trás deles estejam inacabados.
Para uma equipe de dados, a política viável é a mesma independentemente de como os detalhes se resolvam: analise o robots.txt corretamente, saiba a qual uso sua coleta serve, registre todo sinal que se aplicava no momento da coleta, e trate as preferências às quais você não está estritamente vinculado como informação que vale a pena guardar, e não como ruído a ser descartado. As equipes que fizerem isso agora não precisarão reconstruir tudo depois.
Fontes e referências
- IETF, RFC 9309: Robots Exclusion Protocol, setembro de 2022.
- Diretiva (UE) 2019/790 sobre direitos autorais e direitos conexos no Mercado Único Digital. Exceções de mineração de texto e dados.
- Regulamento (UE) 2024/1689, o AI Act. Obrigações para provedores de modelos de IA de propósito geral e datas de aplicação.
- Comissão Europeia, General-Purpose AI Code of Practice, publicado em 10 de julho de 2025, capítulo sobre direitos autorais.
- Bundesgerichtshof, comunicado de imprensa 085/2026 sobre o processo I ZR 281/25, e datas de audiência e decisão.
- Rechtbank Amsterdam, decisão de 30 de outubro de 2024, ECLI:NL:RBAMS:2024:6563.
- Grupo de trabalho AI Preferences do IETF, draft-ietf-aipref-vocab e draft-ietf-aipref-attach.
- W3C Community Group, TDM Reservation Protocol, 10 de maio de 2024.
- Blog da Cloudflare, Content Signals Policy, 24 de setembro de 2025, e Reid Tatoris, sobre o controle do uso de conteúdo para treinamento de IA, 1 de julho de 2025.
- OpenAI, Visão geral dos crawlers da OpenAI; Google, crawlers comuns e user-triggered fetchers; Anthropic, artigo de ajuda sobre crawlers.
- Longpre et al., Consent in Crisis: The Rapid Decline of the AI Data Commons, julho de 2024.
Este artigo é uma informação geral, não um aconselhamento jurídico. Consulte um advogado sobre suas obrigações em cada jurisdição.