Todo web crawl agora contém texto gerado por máquina: páginas de produtos escritas por um modelo, artigos de fazenda de conteúdo produzidos aos milhares, avaliações e posts de fórum que nenhuma pessoa escreveu. Para muitos usos isso é inofensivo. Para dados de treinamento, conjuntos de avaliação e corpora de recuperação não é, e a proporção continua crescendo.
O fato desconfortável é que nenhum detector identifica de forma confiável texto gerado documento por documento. O que funciona é uma abordagem em camadas: vários sinais fracos combinados, calibrados em relação aos seus próprios dados, e aplicados com uma política que corresponda ao propósito do dataset. Este guia cobre os sinais, como combiná-los, e como coletar dados de forma que a filtragem seja possível.
O pipeline geral para construir um dataset via web scraping, incluindo deduplicação e proveniência, está em como construir um dataset com web scraping. Este guia foca especificamente no problema do conteúdo gerado.
Por que isso importa, por caso de uso
| Uso do dataset | Risco do conteúdo gerado | Tolerância típica |
|---|---|---|
| Pré-treinamento de modelo | Estilo homogeneizado, erros amplificados, perda de conhecimento raro | Moderada, com redução de peso |
| Avaliação e benchmarks | Itens de teste que ecoam saídas de modelos inflam pontuações | Muito baixa |
| Corpora de recuperação para RAG | Trechos confiantes mas errados são recuperados como fatos | Baixa para respostas de alto risco |
| Análise de mercado e social | Avaliações e posts falsos distorcem contagens e sentimento | Baixa |
Para treinamento, a preocupação está bem documentada. Pesquisas publicadas mostraram que modelos treinados repetidamente na saída de modelos anteriores perdem as partes mais raras da distribuição de dados original, uma falha descrita como colapso de modelo. Para análises, a preocupação é mais simples: uma tendência de sentimento construída sobre avaliações geradas mede uma campanha de marketing, não clientes. Esse problema é abordado pelo lado da coleta em scraping de plataformas sociais para análise de sentimento.
Por que um único detector não é suficiente
Classificadores de texto de IA são tentadores porque retornam uma pontuação por documento. Na prática, são pouco confiáveis exatamente nas condições que importam para dados da web.
- Textos curtos dão a eles pouco material para trabalhar.
- Texto parafraseado ou levemente editado frequentemente passa como humano.
- Idiomas que não sejam o inglês geralmente são menos bem cobertos.
- Parte da escrita humana é sinalizada com frequência excessiva. Estudos descobriram que detectores classificam erroneamente escrita de falantes não nativos de inglês como gerada por máquina em taxas muito mais altas.
Um grande laboratório de IA retirou seu próprio classificador público de texto em 2023, citando baixa precisão. Trate a pontuação de um classificador como uma característica fraca entre várias, nunca como um veredito.
Sinais que funcionam melhor juntos
Proveniência e tempo
O sinal isolado mais forte não está no texto de forma alguma. É o momento em que o conteúdo foi observado pela primeira vez.
Modelos de texto generativo tornaram-se amplamente disponíveis ao público no final de 2022. Conteúdo observado pela primeira vez antes disso é muito menos provável de ser gerado por máquina, seja lá o que um classificador diga sobre ele. Conteúdo visto pela primeira vez depois disso não é automaticamente suspeito, mas a probabilidade prévia muda.
Isso só funciona se você registrar os horários de observação. Armazene um timestamp de primeira observação para cada documento no momento da coleta, mantenha-o em todas as cópias e transformações, e faça recoletas periodicamente para poder detectar páginas que foram silenciosamente reescritas depois. O argumento para tratar quando e onde uma observação foi feita como parte dos dados está exposto em o padrão de ponto de vantagem.
Sinais em nível de fonte
Conteúdo gerado geralmente é produzido em escala por um pequeno número de operadores, o que torna as fontes mais fáceis de avaliar do que documentos individuais. Pontue domínios e seções, não apenas páginas.
- Velocidade de publicação. Um domínio que passou de algumas páginas por mês para milhares por semana.
- Uniformidade de template. Muitas páginas compartilhando uma estrutura e padrão de título, diferindo apenas no tópico encaixado.
- Dispersão de tópicos. Um único site cobrindo assuntos não relacionados com profundidade uniforme.
- Falta de responsabilidade. Sem autoria, sem página sobre, sem detalhes de contato, ou assinaturas inventadas.
- Densidade de monetização. Páginas que existem principalmente para carregar links de afiliados ou anúncios.
Quase-duplicatas e templates
Fazendas de conteúdo tendem a produzir muitas paráfrases do mesmo esboço. A detecção de quase-duplicatas, tipicamente MinHash com hashing sensível à localidade sobre texto fragmentado, agrupa essas variações. Um grande agrupamento de páginas quase idênticas em muitos domínios é um sinal forte de produção em massa, e inspecionar o agrupamento manualmente é muito mais rápido do que inspecionar páginas uma a uma.
Mantenha o HTML bruto para fontes que você espera analisar dessa forma, já que o próprio template é frequentemente uma assinatura mais clara do que o texto.
Estatísticas de documento
Propriedades estatísticas do texto podem ajudar, desde que tratadas como evidência fraca. Perplexidade muito baixa sob um modelo de linguagem de referência, baixa variação no comprimento e estrutura das frases, e uso intenso de frases de preenchimento genéricas estão todos associados a texto gerado.
Cada um desses também é comum em algumas escritas humanas: documentação simples, notícias curtas formulaicas e texto de escritores não nativos. Use-os apenas em combinação, e calibre-os por idioma.
Marcas d’água, onde existem
Alguns provedores de modelos incorporam marcas d’água estatísticas em texto gerado, e alguns lançaram ferramentas de detecção. Onde uma marca d’água está presente e é detectável, isso é evidência forte. Ela só cobre texto de modelos participantes, só pode ser verificada com o detector do provedor, e paráfrase ou tradução a enfraquecem. Trate um resultado positivo como significativo e um negativo como não informativo.
| Sinal | Força | Principal fraqueza |
|---|---|---|
| Data de primeira observação | Forte para conteúdo mais antigo | Precisa de timestamps registrados na coleta |
| Padrões em nível de fonte | Forte em nível de domínio | Perde páginas geradas isoladas em sites bons |
| Agrupamentos de quase-duplicatas | Forte para fazendas de conteúdo | Perde geração original e isolada |
| Estatísticas de documento | Fraco isoladamente | Penaliza escrita simples e de não nativos |
| Pontuação de classificador | Fraco isoladamente | Não confiável em texto curto, editado ou não em inglês |
| Marca d’água | Forte quando positivo | Ausente na maioria dos textos |
Dos sinais a uma política de filtragem
Combine os sinais em uma única pontuação por documento, com pontuações em nível de fonte alimentando as pontuações de documento. Depois decida o que fazer com cada faixa de pontuação, e deixe a decisão depender do propósito do dataset.
- Manter documentos com pontuação claramente humana ou observados pela primeira vez antes do seu corte.
- Reduzir peso de documentos limítrofes em misturas de pré-treinamento em vez de removê-los.
- Colocar em quarentena documentos provavelmente gerados em um armazenamento separado, para que a decisão possa ser revisitada quando o filtro melhorar.
- Descartar apenas onde o caso de uso exigir, como conjuntos de avaliação, onde a contaminação causa mais dano.
Versione o filtro, e registre na documentação do dataset qual versão produziu qual subconjunto. Um filtro é um conjunto de decisões sobre os dados, e qualquer pessoa que use o dataset depois precisa saber quais foram essas decisões.
Nem todo dado sintético é indesejado. Dados de treinamento gerados deliberadamente têm usos legítimos. O problema é o conteúdo gerado que chega sem rótulo e é confundido com escrita humana, então onde você mesmo produzir dados sintéticos, rotule-os na origem.
Meça o filtro, incluindo quem ele exclui erroneamente
Um filtro que ninguém mediu é um palpite.
Construa um conjunto de validação rotulado a partir do seu próprio crawl: documentos de fontes que você sabe serem escritas por humanos, uma amostra que você mesmo gera com modelos atuais em seus idiomas-alvo, e uma fatia aleatória de casos limítrofes revisados manualmente. Meça precisão e recall por idioma e por domínio.
Depois audite os falsos positivos especificamente. Se o filtro remove desproporcionalmente escrita de falantes não nativos, documentação técnica simples ou regiões específicas, ele está silenciosamente estreitando o dataset de uma forma que aparecerá mais tarde como um modelo que serve pior a esses usuários. O risco mais amplo de um dataset desequilibrado é abordado em seu pool de proxy residencial é uma amostra, não a internet.
Reexecute a avaliação regularmente. Geradores melhoram, e um filtro que funcionava no trimestre passado pode se degradar sem que ninguém perceba.
Colete de forma que a filtragem seja possível
A maioria dos sinais úteis depende de decisões tomadas no momento da coleta.
- Registre timestamps de primeira observação para cada documento, e preserve-os em todas as transformações.
- Armazene metadados de fonte: domínio, seção, data de publicação onde declarada, e o ponto de vantagem de onde a página foi observada.
- Mantenha as respostas brutas para fontes que você possa precisar analisar quanto a templates, e registre-as antes da análise sintática para que um filtro melhor possa ser reaplicado sem recoletar. O padrão está em movendo dados de API de web scraping para SQL.
- Recolete em um cronograma para detectar páginas reescritas após a primeira coleta.
- Prefira fontes humanas primárias: fóruns, sites regionais, documentação e publicações especializadas, em vez de agregadores que os reciclam.
Muitas das melhores fontes escritas por humanos são regionais e fortemente defendidas. Alcançá-las a partir do país certo, com consistência suficiente para recoletar, é onde a infraestrutura de coleta importa. Com o gateway Shifter, o mercado é definido nas credenciais em p.shifter.io:443, e omitir um identificador de sessão rotaciona a saída a cada requisição, o que se adequa a buscas independentes de páginas:
customer-USERNAME-country-br:PASSWORD
Colete de forma responsável: respeite os termos de cada site, mantenha as taxas de requisição proporcionais, e evite coletar dados pessoais que você não precisa. O enquadramento mais amplo está em proxies residenciais éticos para coleta de dados de IA.
Perguntas frequentes
O texto gerado por IA pode ser detectado de forma confiável?
Não de forma confiável para documentos individuais. Sinais combinados entre fontes, agrupamentos e timestamps funcionam muito melhor em escala de dataset do que qualquer classificador por documento.
Todo conteúdo gerado deve ser removido de um conjunto de treinamento?
Não necessariamente. Reduzir o peso de conteúdo limítrofe e rotular dados sintéticos intencionais geralmente é melhor do que a remoção agressiva, que também remove muita escrita humana.
A filtragem reduz a diversidade do dataset?
Pode, se o filtro penalizar escrita simples ou de não nativos. Audite falsos positivos por idioma e região antes de aplicar um filtro em escala.
É seguro tratar conteúdo anterior ao final de 2022 como escrito por humanos?
É uma probabilidade prévia forte, não uma garantia. Conteúdo automatizado anterior também existia. Combine a data com os outros sinais.
Conclusão
Não existe um interruptor que remova conteúdo gerado por IA de um dataset da web. Existe um conjunto de sinais que cada um carrega alguma evidência: quando o conteúdo foi observado pela primeira vez, como sua fonte se comporta, se pertence a um agrupamento de quase-duplicatas, como suas estatísticas se apresentam, e ocasionalmente uma marca d’água. Combinados, calibrados nos seus próprios dados e aplicados com uma política que se ajuste ao propósito do dataset, eles funcionam.
A maior parte disso depende de coletar com timestamps, metadados de fonte e respostas brutas desde o início. A visão do produto está na página de coleta de dados de IA e machine learning, e o lado da coleta é abordado em coletando dados da web para treinamento de IA.