Muitas das investigações mais consequentes começam em registros públicos: um registro de empresas que mostra o mesmo diretor por trás de cinquenta empresas de fachada, editais de licitação que revelam que um contrato foi dividido para ficar abaixo de um limite, processos judiciais que contradizem uma declaração pública. A informação estava pública o tempo todo. O trabalho estava em coletá-la sistematicamente, mantê-la intacta e verificá-la antes que alguém confiasse nela.
Fazer isso em escala é um problema de coleta de dados, e os hábitos que tornam a coleta confiável para empresas importam ainda mais quando o resultado é publicado com assinatura. Este guia apresenta um método para coletar registros públicos para reportagem e pesquisa: por onde começar, como coletar, como preservar evidências, como verificá-las e as questões éticas que vêm junto.
Principais conclusões
- Comece pelos dados em massa e APIs oficiais. Muitos registros publicam downloads gratuitos ou APIs que são mais completos e mais defensáveis do que fazer scraping de seus sites.
- Colete com um plano escrito: o que você precisa, de onde, com que frequência e o que você não vai coletar.
- Preserve cada registro exatamente como foi servido, com um hash, um timestamp e o endereço de onde veio, para que você possa provar depois o que a fonte dizia.
- Verifique antes de publicar: confirme os registros com uma segunda fonte ou com o órgão emissor, e trate qualquer registro isolado como uma pista, não como uma conclusão.
- Público não significa inofensivo. Dados pessoais em registros públicos ainda merecem minimização, cuidado e uma razão clara de interesse público.
Comece pelo que já é publicado para reutilização
Antes de escrever um scraper, verifique se a fonte já publica seus dados para reutilização. Muitas vezes publica, e dados oficiais são mais fáceis de defender do que cópias obtidas por scraping:
| Fonte | O que está disponível | Observações |
|---|---|---|
| UK Companies House | Uma API pública gratuita de dados e downloads em massa gratuitos, incluindo um snapshot mensal de empresas, dados contábeis e um arquivo de pessoas com controle significativo | Diretores, registros e propriedade de empresas do Reino Unido |
| EU procurement, TED | Avisos do suplemento do Jornal Oficial, cerca de 800.000 por ano, disponíveis como dados abertos e por meio de uma API | Licitações e adjudicações de contratos em toda a UE |
| US federal courts, PACER | Registros judiciais eletrônicos a $0.10 por página, com teto de $3 por documento, com taxas dispensadas para usuários que gastam $30 ou menos por trimestre | Processos e peças; os custos se acumulam em escala |
Dados em massa têm outra vantagem: capturam todo o registro em um determinado momento, o que permite encontrar padrões, como agrupamentos de empresas em um mesmo endereço, que a navegação página por página nunca mostra. Onde existe apenas um site, colete a partir dele com cuidado, como descrito abaixo.
Colete com um plano
Um breve plano escrito antes do início da coleta mantém o trabalho focado e defensável:
- A pergunta. O que você está tentando estabelecer, e quais registros poderiam confirmar ou refutar isso.
- As fontes. Quais registros, portais e arquivos, e por que cada um é autoritativo em sua área.
- Os campos. O que você vai coletar, e o que você vai deliberadamente deixar de fora, especialmente dados pessoais de que você não precisa.
- A cadência. Um único snapshot, ou coleta repetida para capturar mudanças e exclusões.
- O método. API oficial, download em massa ou coleta cuidadosa a partir de páginas web, em um ritmo que não imponha carga significativa aos serviços públicos.
A coleta repetida é frequentemente onde as histórias são encontradas. Registros que mudam silenciosamente, registros que são alterados e entradas que desaparecem só são visíveis se você coletou antes e depois. As mesmas técnicas usadas para detecção de mudanças em escala e monitoramento da presença pública de um fornecedor se aplicam diretamente.
Preserve os registros como foram servidos
Uma captura de tela não é evidência suficiente quando uma fonte depois contesta o que publicou. Mantenha o registro exatamente como o servidor o retornou, e o contexto necessário para mostrar de onde e quando ele veio. A função abaixo salva o corpo da resposta sem alterações, nomeado pelo seu hash SHA-256, e acrescenta uma linha de log com a URL, o status, o horário e o hash:
import hashlib
import json
from datetime import datetime, timezone
from pathlib import Path
import requests
def capture(url, folder, session=None, note=""):
"""Save a public record exactly as served, with a hash and the context needed to verify it later."""
session = session or requests.Session()
response = session.get(url, timeout=30)
body = response.content
digest = hashlib.sha256(body).hexdigest()
retrieved = datetime.now(timezone.utc).isoformat(timespec="seconds")
folder = Path(folder)
folder.mkdir(parents=True, exist_ok=True)
(folder / f"{digest}.body").write_bytes(body)
record = {
"requested_url": url,
"final_url": response.url,
"status": response.status_code,
"retrieved_utc": retrieved,
"sha256": digest,
"bytes": len(body),
"content_type": response.headers.get("content-type", ""),
"last_modified": response.headers.get("last-modified"),
"note": note,
}
with open(folder / "log.jsonl", "a", encoding="utf-8") as log:
log.write(json.dumps(record) + "\n")
return record
Usado em uma página pública de empresa do registro do Reino Unido:
import requests
from capture import capture
session = requests.Session()
session.headers["User-Agent"] = "ExampleNewsroom/1.0 (+https://example.org/research)"
record = capture("https://find-and-update.company-information.service.gov.uk/company/00445790",
"records", session, note="registered office check")
print(record["status"], record["sha256"], record["retrieved_utc"])
Duas capturas dessa página com dez segundos de diferença produziram o mesmo hash, e esse é o ponto: se um registro não mudou, qualquer um pode confirmar isso byte a byte, e se mudar, o hash mostra exatamente quando. Para coleções maiores, o formato WARC descrito em mantendo a resposta bruta armazena solicitações e respostas juntas com ferramentas padrão, e evidências prontas para processo judicial a partir de anúncios online cobre as etapas extras quando o material pode acabar em processos judiciais. Uma captura em um arquivo web público, feita ao mesmo tempo, adiciona uma corroboração independente.
Registre também de onde a coleta foi feita. Alguns portais mostram conteúdo ou idioma diferentes conforme a localização do visitante, e anotar o ponto de observação, como argumentado em o caso para um padrão de ponto de observação, permite que outros reproduzam o que você viu.
Verifique antes de publicar
Registros públicos frequentemente estão errados, desatualizados ou ambíguos. Os registros documentam o que foi declarado, não o que é verdade; nomes são reutilizados; endereços são compartilhados por muitas empresas registradas pela mesma agência de constituição. A verificação transforma um registro em uma conclusão:
| Verificação | Contra o que ela protege |
|---|---|
| Confirme com o órgão emissor ou uma segunda fonte oficial | Erros de transcrição e entradas desatualizadas |
| Combine por identificadores, não por nomes | Pessoas ou empresas diferentes com o mesmo nome |
| Verifique datas e versões | Registros alterados, registros substituídos, confusão de fuso horário |
| Procure explicações inocentes | Endereços de agências de constituição, diretores indicados, registros de rotina |
| Pergunte ao sujeito antes da publicação | Contexto que os registros não mostram, e justiça |
| Mantenha a cadeia da afirmação ao registro | Cada declaração publicada rastreada até um registro preservado e com hash |
A última linha é a disciplina que mais importa. Cada afirmação factual em uma matéria deve apontar para um registro específico preservado, e qualquer pessoa da equipe deve conseguir abri-lo e ver o que ele dizia no dia em que foi coletado.
Ética
Coletar registros públicos levanta as mesmas questões éticas de qualquer reportagem. O código de ética da Society of Professional Journalists organiza isso em quatro princípios: buscar a verdade e relatá-la, minimizar o dano, agir com independência e ser responsável e transparente. Alguns se aplicam com força particular à coleta em massa:
- Público não é o mesmo que inofensivo. Registros contêm endereços residenciais, datas de nascimento e detalhes familiares. Colete apenas o que a matéria precisa, restrinja o acesso ao restante, e pense bem antes de publicar detalhes pessoais de pessoas que não são o objeto da investigação.
- A agregação cria informação nova. Combinar registros pode revelar coisas que nenhum registro isolado revela, o que muitas vezes é o próprio ponto da investigação e também o risco. Pondere o interesse público daquilo que a combinação revela.
- Colete com respeito. Serviços públicos são pagos pelo público. Use dados em massa onde existirem, module o ritmo da coleta, identifique seu coletor honestamente, e não contorne controles de acesso.
- Atente-se à legislação de onde você trabalha. Regras de proteção de dados, direitos autorais e uso indevido de computadores também se aplicam a jornalistas, e muitas jurisdições oferecem isenções específicas para fins jornalísticos ou de pesquisa, com suas próprias condições. Nossas visões gerais sobre se o web scraping é legal e GDPR e coleta de dados são um ponto de partida; consulte a assessoria jurídica da sua redação para projetos específicos.
Conclusão
Registros públicos são uma das fontes mais poderosas que uma investigação pode ter, e uma das mais fáceis de usar mal. Comece pelos dados em massa e APIs oficiais, colete seguindo um plano escrito, preserve cada registro exatamente como foi servido com um hash e um timestamp, verifique cada conclusão com uma segunda fonte e com o sujeito, e mantenha os dados pessoais limitados ao que a matéria precisa.
O resultado é uma reportagem que se sustenta: cada afirmação rastreável até um registro que qualquer um pode verificar, coletado de uma forma que a redação consegue explicar.
Fontes e referências
- Companies House, Companies House data products.
- European Commission, Tenders Electronic Daily.
- PACER, Pricing: how fees work.
- Society of Professional Journalists, Code of Ethics.
- Código de captura testado pela Shifter em 5 de outubro de 2026 contra uma página pública do Companies House.