Conhecimento

robots.txt, Opt-Outs de IA e Sinais de Reserva: O Que os Coletores de Dados da Web Devem Respeitar em 2026

O robots.txt agora tem peso legal na UE, e novos sinais de IA estão se espalhando. O que cada um significa, o que os crawlers de IA respeitam e como as equipes de dados devem responder.

James Meadow

James Meadow

26 de setembro de 2026 · 15 min de leitura

Durante a maior parte de seus trinta anos de existência, o robots.txt foi uma cortesia: um arquivo de texto simples pedindo aos crawlers que ficassem fora de determinados caminhos, sem nada por trás além de boas maneiras. Isso mudou. Ele se tornou um padrão formal da internet em 2022. Na UE, os opt-outs legíveis por máquina agora decidem se a mineração de texto e dados é lícita, e os provedores de modelos de IA têm o dever legal de encontrá-los e respeitá-los. Enquanto isso, surgiu uma safra de novos sinais, cada um alegando dizer o que um site permite que sistemas de IA façam com seu conteúdo.

Para quem coleta dados públicos da web, e especialmente para quem tem seus dados usados no treinamento ou na alimentação de modelos de IA, a questão prática é simples: quais desses sinais você precisa ler, o que eles significam e o que você deve fazer a respeito? Este guia apresenta o estado atual, em setembro de 2026.

Principais conclusões

  • O robots.txt é um padrão do IETF, a RFC 9309. Ele define regras precisas de correspondência, mas afirma claramente que suas regras “não são uma forma de autorização de acesso.”
  • Na UE, a exceção comercial de mineração de texto e dados se aplica apenas quando os titulares de direitos não reservaram seus direitos “de maneira apropriada, como por meios legíveis por máquina” para conteúdo online. Tribunais alemães entenderam que essa reserva só é eficaz em formato legível por máquina.
  • Os provedores de modelos de IA de propósito geral são obrigados, desde 2 de agosto de 2025, a identificar e cumprir essas reservas. O poder da Comissão de multá-los se aplica a partir de 2 de agosto de 2026.
  • Existem novos sinais de preferência, do Content Signals da Cloudflare ao rascunho de vocabulário de preferências de IA do IETF, mas nenhum deles ainda é um padrão finalizado. Registre-os mesmo quando não forem vinculantes.
  • Usar uma rede de proxies não muda o que um site pediu. As obrigações se vinculam ao que você coleta e a como você usa, não ao endereço IP a partir do qual você coleta.

O robots.txt agora é um padrão

A RFC 9309, publicada em setembro de 2022, transformou uma convenção de fato em um Proposed Standard. Várias de suas regras surpreendem quem só leu arquivos robots.txt a olho nu:

  • A regra mais específica vence. “A correspondência mais específica encontrada DEVE ser usada”, medida pelo comprimento da regra correspondente, com allow preferido quando uma regra de allow e uma de disallow forem equivalentes. A ordem no arquivo não importa.
  • A correspondência de agente não diferencia maiúsculas de minúsculas, e um crawler sem grupo correspondente recorre ao grupo *.
  • Erros significam coisas diferentes. Se o robots.txt estiver indisponível, com uma resposta 4xx, um crawler pode acessar qualquer coisa. Se estiver inacessível devido a erros de servidor ou de rede, o crawler “DEVE presumir bloqueio total.”
  • O cache é limitado. Os crawlers “NÃO DEVEM usar a versão em cache por mais de 24 horas, a menos que o arquivo robots.txt esteja inacessível.”

E o limite mais importante: “Essas regras não são uma forma de autorização de acesso.” O robots.txt não torna o conteúdo privado, e ignorá-lo não é o mesmo que invadir um sistema. O que lhe dá peso em alguns contextos é a lei, não o protocolo em si.

Por que isso importa juridicamente na UE

As regras de direitos autorais da UE permitem a mineração de texto e dados de conteúdo licitamente acessível, com duas exceções diferentes. Uma cobre organizações de pesquisa e instituições de patrimônio cultural que realizam pesquisa científica, e não tem opt-out. A outra cobre todos os demais, incluindo a mineração comercial, mas se aplica apenas quando o uso “não tiver sido expressamente reservado por seus titulares de direitos de maneira apropriada, como por meios legíveis por máquina, no caso de conteúdo disponibilizado publicamente online.”

O AI Act então aplica essa regra à IA. Os provedores de modelos de IA de propósito geral devem “implementar uma política para cumprir a legislação da União sobre direitos autorais e direitos conexos e, em particular, identificar e cumprir, inclusive por meio de tecnologias de ponta, uma reserva de direitos” feita nos termos das regras de direitos autorais. Essas obrigações se aplicam desde 2 de agosto de 2025. Os poderes de multa da Comissão sobre os provedores de IA de propósito geral, de até 3% do faturamento mundial, se aplicam a partir de 2 de agosto de 2026, e os modelos colocados no mercado antes de agosto de 2025 têm até 2 de agosto de 2027 para se adequar.

O voluntário General-Purpose AI Code of Practice, publicado em julho de 2025, torna isso concreto. Os signatários se comprometem “a empregar web crawlers que leiam e sigam instruções expressas de acordo com o Robot Exclusion Protocol (robots.txt), conforme especificado na” RFC 9309, e a identificar e cumprir outros protocolos apropriados legíveis por máquina. Duas ressalvas do Código merecem atenção. A adesão “não constitui conformidade com a legislação da União sobre direitos autorais e direitos conexos.” E o compromisso não afeta a forma como os direitos autorais se aplicam a conteúdo “extraído ou rastreado da internet por terceiros” e usado pelos signatários. Comprar um conjunto de dados não legitima as reservas que se aplicavam às suas fontes.

O que os tribunais disseram

A jurisprudência ainda está se formando, e duas decisões ilustram a direção.

Na Alemanha, um fotógrafo processou a organização sem fins lucrativos LAION pelo uso de sua imagem em um conjunto de dados de treinamento de IA. Os tribunais de Hamburgo rejeitaram a ação. Em recurso, o Tribunal Regional Superior entendeu, nas palavras do resumo do Tribunal Federal de Justiça, que uma reserva para obras online só é eficaz “in maschinenlesbarer Form”, ou seja, em formato legível por máquina, e que o autor da ação não havia demonstrado que sua reserva, redigida em linguagem natural nos termos de uso, era legível por máquina no momento relevante. O Tribunal Federal de Justiça analisou o recurso adicional em 3 de setembro de 2026 e agendou sua decisão para 17 de dezembro de 2026.

Nos Países Baixos, um tribunal de Amsterdã decidiu, em 30 de outubro de 2024, uma disputa entre editoras de jornais e um agregador de notícias. O agregador argumentou, e as editoras não contestaram, que seu robots.txt excluía apenas determinados bots de IA, como GPTBot, ChatGPT-User e CCBot. Isso não foi suficiente para estabelecer que os direitos haviam sido reservados de maneira apropriada e legível por máquina para o uso do agregador, de modo que a exceção se aplicou.

Ambas apontam na mesma direção: o que conta são os sinais legíveis por máquina, e um sinal direcionado a bots específicos pode não reservar direitos contra todos os demais. Nenhuma das duas é uma orientação definitiva, e ambas dependem dos fatos. Leve questões específicas a um advogado.

Os sinais que você vai encontrar

SignalWhere it livesStatusWhat it expresses
robots.txt Allow e Disallow/robots.txtPadrão do IETF, RFC 9309Se um crawler nomeado pode acessar um caminho
Content SignalsLinhas no robots.txt, como Content-Signal: search=yes, ai-train=noPolítica da Cloudflare, publicada em setembro de 2025Preferências para busca, entrada de IA e treinamento de IA
Preferências de IA (Content-Usage)Linhas no robots.txt ou um cabeçalho HTTP, como Content-Usage: train-ai=nRascunhos do grupo de trabalho do IETF, ainda não são padrõesPreferências para treinamento de IA, uso de IA e busca
TDMRep/.well-known/tdmrep.json, um cabeçalho HTTP tdm-reservation ou meta tag HTMLRelatório do W3C Community Group, não é um W3C StandardSe os direitos de mineração de texto e dados estão reservados
Termos de serviçoAs páginas legais do siteContrato e, na UE, possivelmente uma reserva se for legível por máquinaO que quer que os termos do site digam

Dois detalhes importam. O Content Signals da Cloudflare define search, ai-input (para recuperação, embasamento e respostas geradas) e ai-train, e a política declara que “os content signals expressam preferências; não são contramedidas técnicas contra scraping.” Ela também declara que as restrições expressas por meio dos sinais são reservas expressas de direitos nos termos das regras de direitos autorais da UE. Os rascunhos do IETF, por sua vez, são genuinamente inacabados: o rascunho atual de vocabulário traz uma nota de que seu conteúdo “NÃO REFLETE O CONSENSO do Working Group”. Espere que os rótulos mudem.

Como os principais crawlers de IA os tratam

Os operadores publicam suas próprias regras, e elas diferem, especialmente para buscas feitas em nome de um usuário.

OperatorAgentWhat blocking it does, per the operator
OpenAIGPTBotIndica que o conteúdo “não deve ser usado no treinamento de modelos de fundação de IA generativa”
OpenAIOAI-SearchBotO site não aparece nas respostas de busca do ChatGPT, embora ainda possa aparecer como links de navegação
OpenAIChatGPT-UserIniciado pelo usuário; “as regras do robots.txt podem não se aplicar”
GoogleGoogle-ExtendedUm token de robots.txt sem user agent próprio; controla o uso para treinamento e embasamento dos modelos Gemini, e “não afeta a inclusão de um site no Google Search”
GoogleUser-triggered fetchers”geralmente ignoram as regras do robots.txt”
AnthropicClaudeBot, Claude-User, Claude-SearchBotBloquear o ClaudeBot exclui conteúdo futuro do treinamento; bloquear o Claude-User impede a recuperação para consultas de usuários; os bots respeitam o robots.txt e o crawl-delay

Para uma equipe de dados, a lição é que “bloquear IA” não é um único interruptor. Um site pode permitir a indexação para busca e ao mesmo tempo recusar o treinamento, ou recusar o treinamento e ainda assim ser buscado ao vivo quando um usuário pergunta sobre ele. Leia os sinais para o uso que você realmente faz.

Quantos sites optam por sair

Os opt-outs cresceram rapidamente. O estudo “Consent in Crisis” da Data Provenance Initiative, uma auditoria de 14.000 domínios web publicada em julho de 2024, constatou que, em um único ano, as restrições do robots.txt tornaram “totalmente restritos ~5%+ de todos os tokens do C4, ou 28%+ das fontes críticas mais ativamente mantidas do C4”, e que “quanto às restrições de rastreamento nos Termos de Serviço, 45% do C4 já está restrito.” A cobertura é desigual no topo da web, porém: a Cloudflare relatou em julho de 2025 que “apenas cerca de 37% dos 10.000 principais domínios atualmente têm um arquivo robots.txt”, e que o GPTBot era proibido em 7.8% desses arquivos.

O que um coletor responsável deve fazer

Independentemente de você treinar modelos ou não, uma política clara protege você e os sites dos quais você depende.

  1. Busque e obedeça o robots.txt corretamente. Armazene-o em cache por no máximo 24 horas, trate erros de servidor como “bloquear tudo” e faça a correspondência de regras conforme a RFC 9309.
  2. Conheça seu propósito. Indexação, recuperação para respostas ao vivo e treinamento de modelos são usos diferentes, e os sinais mais recentes os tratam de forma diferente. Decida a qual deles sua coleta serve e leia os sinais para esse uso.
  3. Registre os sinais junto com os dados. Armazene as regras de robots.txt, os content signals e os cabeçalhos TDMRep que se aplicavam no momento da coleta junto com cada registro. Se um conjunto de dados for usado depois para IA, esse registro é como você demonstra que as reservas foram identificadas. Ele pertence ao mesmo registro de proveniência que o ponto de vista e o horário de captura.
  4. Avalie os termos de serviço com um advogado. Eles podem importar contratualmente em qualquer lugar, e na UE podem contar como uma reserva se expressos de maneira legível por máquina.
  5. Ajuste o ritmo da sua coleta. Respeitar limites de rastreamento e reduzir a atividade sob carga faz parte dessa mesma boa-fé, conforme abordado em limitação de taxa e controle de requisições.

Um alerta sobre ferramentas: o urllib.robotparser, embutido no Python, aplica as regras na ordem do arquivo, e não pela correspondência mais específica. Dado Disallow: /shop seguido de Allow: /shop/public, ele indica /shop/public/item como bloqueado; inverta as duas linhas e ele diz que é permitido. A RFC 9309 diz que é permitido nos dois casos. Um pequeno verificador que segue a RFC, e registra as linhas de preferência de IA que encontra, se parece com isto:

import re
import urllib.error
import urllib.request


def _groups(text):
    """Parse robots.txt into (agents, rules, extras) groups, following RFC 9309 grouping."""
    groups, agents, rules, extras, last = [], [], [], [], None
    for raw in text.splitlines():
        line = raw.split("#", 1)[0].strip()
        if ":" not in line:
            continue
        key, value = (p.strip() for p in line.split(":", 1))
        key = key.lower()
        if key == "user-agent":
            if last != "user-agent" and agents:
                groups.append((agents, rules, extras))
                agents, rules, extras = [], [], []
            agents.append(value.lower())
        elif key in ("allow", "disallow") and agents:
            rules.append((key, value))
        elif key in ("content-signal", "content-usage") and agents:
            extras.append((key, value))
        last = key
    if agents:
        groups.append((agents, rules, extras))
    return groups


def _pattern(path):
    regex = re.escape(path).replace(r"\*", ".*")
    return re.compile(regex[:-2] + "$" if regex.endswith(r"\$") else regex)


def check(robots_txt, user_agent, path):
    """Allow/disallow per RFC 9309 (most specific match wins, allow on ties), plus AI signals."""
    token = user_agent.lower()
    groups = _groups(robots_txt)
    matched = [g for g in groups if token in g[0]] or [g for g in groups if "*" in g[0]]
    rules = [r for g in matched for r in g[1]]
    extras = [e for g in matched for e in g[2]]
    best = None
    for kind, value in rules:
        if value and _pattern(value).match(path):
            length = len(value)
            if best is None or length > best[1] or (length == best[1] and kind == "allow"):
                best = (kind, length)
    return {"allowed": best is None or best[0] == "allow", "signals": extras}


def fetch_robots(origin, opener=None):
    """Fetch robots.txt. Per RFC 9309: 4xx means no rules; 5xx or network failure means disallow all."""
    opener = opener or urllib.request.build_opener()
    try:
        with opener.open(origin.rstrip("/") + "/robots.txt", timeout=30) as r:
            return r.read(512 * 1024).decode("utf-8", "replace")
    except urllib.error.HTTPError as e:
        return "" if 400 <= e.code < 500 else "User-agent: *\nDisallow: /"
    except OSError:
        return "User-agent: *\nDisallow: /"

Ele é propositalmente pequeno. Crawlers de produção também deveriam verificar os cabeçalhos TDMRep e o arquivo /.well-known/tdmrep.json quando o treinamento estiver no escopo, e manter uma cópia datada de cada robots.txt em que se basearam.

Onde os proxies se encaixam

Os proxies residenciais mudam de onde uma requisição parece vir. Eles não mudam o que um site pediu a você, nem mudam suas obrigações sob a lei de direitos autorais ou os termos de um site. As regras da UE se vinculam ao uso do conteúdo, e o Code of Practice mantém explicitamente a coleta por terceiros dentro do escopo. Use uma rede de proxies para ver a web como usuários reais em um determinado mercado a veem, para distribuir a carga com educação e medir com honestidade, e aplique as mesmas verificações de robots.txt e de reserva que você aplicaria a partir de seus próprios servidores. O argumento mais amplo é apresentado em proxies residenciais éticos para coleta de dados de IA.

Conclusão

O robots.txt amadureceu. É um padrão com regras precisas, e na UE, reservas legíveis por máquina construídas sobre ele e ao seu lado agora decidem se a mineração de texto e dados é permitida, com os provedores de IA sob o dever legal direto de respeitá-las e multas disponíveis a partir de agosto de 2026. Novos sinais para busca, entrada de IA e treinamento estão se espalhando rapidamente, ainda que os padrões por trás deles estejam inacabados.

Para uma equipe de dados, a política viável é a mesma independentemente de como os detalhes se resolvam: analise o robots.txt corretamente, saiba a qual uso sua coleta serve, registre todo sinal que se aplicava no momento da coleta, e trate as preferências às quais você não está estritamente vinculado como informação que vale a pena guardar, e não como ruído a ser descartado. As equipes que fizerem isso agora não precisarão reconstruir tudo depois.

Fontes e referências

Este artigo é uma informação geral, não um aconselhamento jurídico. Consulte um advogado sobre suas obrigações em cada jurisdição.

Pronto para começar?

Experimente os proxies residenciais da Shifter, mais de 205M IPs, mais de 195 países, a partir de $ 0,75/GB.

Começar