Muchas de las investigaciones más trascendentales comienzan en registros públicos: un registro de empresas que muestra al mismo administrador detrás de cincuenta empresas pantalla, avisos de contratación pública que revelan que un contrato se dividió para quedar por debajo de un umbral, escritos judiciales que contradicen una declaración pública. La información fue pública todo el tiempo. El trabajo consistió en recopilarla de forma sistemática, mantenerla intacta y verificarla antes de que nadie confiara en ella.
Hacer esto a escala es un problema de recopilación de datos, y los hábitos que hacen que la recopilación sea fiable para las empresas importan aún más cuando el resultado se publica bajo una firma. Esta guía establece un método para recopilar registros públicos con fines periodísticos y de investigación: por dónde empezar, cómo recopilar, cómo preservar las pruebas, cómo verificarlas y las cuestiones éticas que conlleva.
Puntos clave
- Empieza por los datos masivos y las API oficiales. Muchos registros publican descargas gratuitas o API que son más completas y más defendibles que extraer datos de sus sitios web.
- Recopila con un plan escrito: qué necesitas, de dónde, con qué frecuencia y qué no vas a recopilar.
- Conserva cada registro exactamente como se sirvió, con un hash, una marca de tiempo y la dirección de donde procede, para poder demostrar más tarde qué decía la fuente.
- Verifica antes de publicar: confirma los registros con una segunda fuente o con el organismo emisor, y trata cualquier registro aislado como una pista, no como una conclusión.
- Público no significa inofensivo. Los datos personales en registros públicos siguen mereciendo minimización, cuidado y una razón clara de interés público.
Empieza por lo que está publicado para su reutilización
Antes de escribir un scraper, comprueba si la fuente ya publica sus datos para su reutilización. A menudo lo hace, y los datos oficiales son más fáciles de defender que las copias obtenidas mediante scraping:
| Fuente | Qué está disponible | Notas |
|---|---|---|
| UK Companies House | Una API de datos públicos gratuita y descargas masivas gratuitas, incluyendo una instantánea mensual de empresas, datos de cuentas y un archivo de personas con control significativo | Directivos, presentaciones y propiedad de empresas del Reino Unido |
| Contratación pública de la UE, TED | Avisos del suplemento del Diario Oficial, alrededor de 800.000 al año, disponibles como datos abiertos y a través de una API | Licitaciones y adjudicaciones de contratos en toda la UE |
| Tribunales federales de EE. UU., PACER | Registros judiciales electrónicos a $0.10 la página, con un tope de $3 por documento, con tarifas exentas para usuarios que gastan $30 o menos por trimestre | Expedientes y presentaciones; los costes se acumulan a escala |
Los datos masivos tienen otra ventaja: capturan todo el registro en un momento dado, lo que permite encontrar patrones, como grupos de empresas en una misma dirección, que la navegación página por página nunca muestra. Cuando solo existe un sitio web, recopila a partir de él con cuidado, como se describe a continuación.
Recopila con un plan
Un breve plan escrito antes de iniciar la recopilación mantiene el trabajo centrado y defendible:
- La pregunta. Qué intentas establecer, y qué registros podrían confirmarlo o refutarlo.
- Las fuentes. Qué registros, portales y archivos, y por qué cada uno es autoritativo para su parte.
- Los campos. Qué vas a recopilar, y qué vas a dejar fuera deliberadamente, especialmente datos personales que no necesitas.
- La cadencia. Una instantánea única, o recopilación repetida para detectar cambios y eliminaciones.
- El método. API oficial, descarga masiva o recopilación cuidadosa a partir de páginas web, a un ritmo que no suponga una carga significativa para los servicios públicos.
La recopilación repetida es a menudo donde se encuentran las historias. Los registros que cambian silenciosamente, las presentaciones que se modifican y las entradas que desaparecen solo son visibles si recopilaste antes y después. Las mismas técnicas utilizadas para la detección de cambios a gran escala y el seguimiento de la huella pública de un proveedor se aplican directamente.
Conserva los registros tal como se sirvieron
Una captura de pantalla no es suficiente prueba cuando una fuente discute más tarde lo que publicó. Conserva el registro exactamente como lo devolvió el servidor, y el contexto necesario para demostrar de dónde y cuándo procede. La función siguiente guarda el cuerpo de la respuesta sin modificar, nombrado con su hash SHA-256, y añade una línea de registro con la URL, el estado, la hora y el hash:
import hashlib
import json
from datetime import datetime, timezone
from pathlib import Path
import requests
def capture(url, folder, session=None, note=""):
"""Save a public record exactly as served, with a hash and the context needed to verify it later."""
session = session or requests.Session()
response = session.get(url, timeout=30)
body = response.content
digest = hashlib.sha256(body).hexdigest()
retrieved = datetime.now(timezone.utc).isoformat(timespec="seconds")
folder = Path(folder)
folder.mkdir(parents=True, exist_ok=True)
(folder / f"{digest}.body").write_bytes(body)
record = {
"requested_url": url,
"final_url": response.url,
"status": response.status_code,
"retrieved_utc": retrieved,
"sha256": digest,
"bytes": len(body),
"content_type": response.headers.get("content-type", ""),
"last_modified": response.headers.get("last-modified"),
"note": note,
}
with open(folder / "log.jsonl", "a", encoding="utf-8") as log:
log.write(json.dumps(record) + "\n")
return record
Utilizada en una página pública de empresa del registro del Reino Unido:
import requests
from capture import capture
session = requests.Session()
session.headers["User-Agent"] = "ExampleNewsroom/1.0 (+https://example.org/research)"
record = capture("https://find-and-update.company-information.service.gov.uk/company/00445790",
"records", session, note="registered office check")
print(record["status"], record["sha256"], record["retrieved_utc"])
Dos capturas de esa página con diez segundos de diferencia produjeron el mismo hash, que es precisamente el objetivo: si un registro no ha cambiado, cualquiera puede confirmarlo byte a byte, y si cambia, el hash muestra exactamente cuándo. Para colecciones más grandes, el formato WARC descrito en conservar la respuesta en bruto almacena solicitudes y respuestas juntas con herramientas estándar, y pruebas listas para un tribunal a partir de anuncios en línea cubre los pasos adicionales cuando el material pueda acabar en un procedimiento judicial. Una captura en un archivo web público, realizada al mismo tiempo, añade corroboración independiente.
Registra también desde dónde se realizó la recopilación. Algunos portales muestran contenido o idioma distinto según la ubicación del visitante, y anotar el punto de vista, como se argumenta en el caso a favor de un estándar de punto de vista, permite a otros reproducir lo que viste.
Verifica antes de publicar
Los registros públicos a menudo son erróneos, están desactualizados o son ambiguos. Los registros reflejan lo que se presentó, no lo que es cierto; los nombres se reutilizan; las direcciones son compartidas por muchas empresas registradas a través del mismo agente de constitución. La verificación convierte un registro en una conclusión:
| Comprobación | Contra qué protege |
|---|---|
| Confirmar con el organismo emisor o una segunda fuente oficial | Errores de transcripción y entradas desactualizadas |
| Contrastar por identificadores, no por nombres | Personas o empresas distintas con el mismo nombre |
| Comprobar fechas y versiones | Presentaciones modificadas, registros sustituidos, confusión de zonas horarias |
| Buscar explicaciones inocentes | Direcciones de agentes de constitución, administradores nominales, presentaciones rutinarias |
| Preguntar al sujeto antes de la publicación | Contexto que los registros no muestran, y equidad |
| Mantener la cadena desde la afirmación hasta el registro | Cada afirmación publicada rastreada hasta un registro conservado y con hash |
La última fila es la disciplina que más importa. Cada afirmación factual en una historia debe remitir a un registro concreto conservado, y cualquier miembro del equipo debe poder abrirlo y ver qué decía el día en que se recopiló.
Ética
Recopilar registros públicos plantea las mismas cuestiones éticas que cualquier trabajo periodístico. El código de la Society of Professional Journalists las organiza bajo cuatro principios: buscar la verdad y comunicarla, minimizar el daño, actuar con independencia, y rendir cuentas y ser transparente. Algunos se aplican con especial fuerza a la recopilación masiva:
- Público no es lo mismo que inofensivo. Los registros contienen direcciones particulares, fechas de nacimiento y datos familiares. Recopila solo lo que la historia necesita, restringe el acceso al resto, y piénsalo bien antes de publicar datos personales de personas que no son el objeto de la investigación.
- La agregación crea información nueva. Combinar registros puede revelar cosas que ningún registro aislado muestra, lo cual es a menudo el objetivo de la investigación y también el riesgo. Sopesa el interés público de lo que muestra la combinación.
- Recopila con respeto. Los servicios públicos están pagados por el público. Usa datos masivos cuando existan, marca un ritmo en la recopilación, identifica a tu recopilador con honestidad y no eludas los controles de acceso.
- Ten presente la ley donde trabajas. Las normas de protección de datos, propiedad intelectual y uso indebido de ordenadores se aplican también a los periodistas, y muchas jurisdicciones prevén exenciones específicas para fines periodísticos o de investigación con sus propias condiciones. Nuestras guías sobre si el web scraping es legal y el RGPD y la recopilación de datos son un punto de partida; consulta con la asesoría legal de tu redacción para proyectos concretos.
En resumen
Los registros públicos son una de las fuentes más potentes que puede tener una investigación, y una de las más fáciles de usar mal. Empieza por los datos masivos y las API oficiales, recopila siguiendo un plan escrito, conserva cada registro exactamente como se sirvió con un hash y una marca de tiempo, verifica cada hallazgo con una segunda fuente y con el sujeto, y limita los datos personales a lo que la historia necesita.
El resultado es un trabajo periodístico que se sostiene: cada afirmación rastreable hasta un registro que cualquiera puede comprobar, recopilado de una forma que la redacción puede explicar.
Fuentes y referencias
- Companies House, Companies House data products.
- Comisión Europea, Tenders Electronic Daily.
- PACER, Pricing: how fees work.
- Society of Professional Journalists, Code of Ethics.
- Código de captura probado por Shifter el 5 de octubre de 2026 contra una página pública de Companies House.