Base de connaissances

Collecte de dossiers publics pour le journalisme d'investigation : méthode, éthique et vérification

Les dossiers publics alimentent les enquêtes, mais seulement s'ils sont collectés avec soin, préservés tels que fournis et vérifiés avant publication. Une méthode pour les salles de rédaction.

James Meadow

5 octobre 2026 · 9 min de lecture

De nombreuses enquêtes parmi les plus importantes commencent dans les registres publics : un registre d’entreprises qui montre le même dirigeant derrière cinquante sociétés écrans, des avis de marchés publics qui révèlent qu’un contrat a été découpé pour rester sous un seuil, des pièces de procédure judiciaire qui contredisent une déclaration publique. L’information était publique depuis le début. Le travail consistait à la collecter méthodiquement, à la conserver intacte, et à la vérifier avant que quiconque ne s’y fie.

Faire cela à grande échelle est un problème de collecte de données, et les habitudes qui rendent la collecte fiable pour les entreprises comptent encore plus lorsque le résultat est publié sous une signature. Ce guide présente une méthode de collecte des registres publics pour le journalisme et la recherche : par où commencer, comment collecter, comment préserver les preuves, comment les vérifier, et les questions éthiques qui en découlent.

Points clés

  • Commencez par les données en masse et les API officielles. De nombreux registres publient des téléchargements gratuits ou des API plus complets et plus défendables que le scraping de leurs sites web.
  • Collectez selon un plan écrit : ce dont vous avez besoin, d’où, à quelle fréquence, et ce que vous ne collecterez pas.
  • Conservez chaque enregistrement exactement tel qu’il a été servi, avec un hash, un horodatage et l’adresse d’origine, afin de pouvoir prouver plus tard ce que disait la source.
  • Vérifiez avant de publier : confirmez les enregistrements auprès d’une seconde source ou de l’organisme émetteur, et traitez tout enregistrement isolé comme une piste, pas comme une conclusion.
  • Public ne veut pas dire inoffensif. Les données personnelles contenues dans les registres publics méritent toujours une minimisation, une attention et une raison d’intérêt public claire.

Commencez par ce qui est publié pour réutilisation

Avant d’écrire un scraper, vérifiez si la source publie déjà ses données pour réutilisation. C’est souvent le cas, et les données officielles sont plus faciles à défendre que des copies issues de scraping :

SourceCe qui est disponibleRemarques
UK Companies HouseUne API de données publiques gratuite et des téléchargements en masse gratuits, incluant un instantané mensuel des sociétés, des données comptables et un fichier des personnes ayant un contrôle significatifDirigeants, dépôts et actionnariat pour les sociétés britanniques
EU procurement, TEDAvis du supplément au Journal officiel, environ 800 000 par an, disponibles en données ouvertes et via une APIAppels d’offres et attributions de marchés dans toute l’UE
US federal courts, PACERRegistres judiciaires électroniques à 0,10 $ la page, plafonnés à 3 $ par document, avec frais levés pour les utilisateurs dépensant 30 $ ou moins par trimestreDossiers et pièces de procédure ; les coûts s’accumulent à grande échelle

Les données en masse ont un autre avantage : elles capturent l’intégralité du registre à un instant donné, ce qui permet de repérer des schémas, comme des grappes de sociétés à une même adresse, que la navigation page par page ne révèle jamais. Lorsque seul un site web existe, collectez-y avec soin, comme décrit ci-dessous.

Collectez selon un plan

Un court plan écrit avant le début de la collecte permet de garder le travail ciblé et défendable :

  • La question. Ce que vous essayez d’établir, et quels enregistrements pourraient le confirmer ou l’infirmer.
  • Les sources. Quels registres, portails et archives, et pourquoi chacun fait autorité dans son domaine.
  • Les champs. Ce que vous allez collecter, et ce que vous laisserez délibérément de côté, en particulier les données personnelles dont vous n’avez pas besoin.
  • La cadence. Un instantané unique, ou une collecte répétée pour détecter les changements et les suppressions.
  • La méthode. API officielle, téléchargement en masse ou collecte attentive depuis des pages web, à un rythme qui n’impose aucune charge significative aux services publics.

La collecte répétée est souvent le moyen de trouver des histoires. Les enregistrements qui changent discrètement, les dépôts qui sont modifiés et les entrées qui disparaissent ne sont visibles que si vous avez collecté avant et après. Les mêmes techniques utilisées pour la détection de changements à grande échelle et la surveillance de l’empreinte publique d’un fournisseur s’appliquent directement.

Préservez les enregistrements tels que servis

Une capture d’écran n’est pas une preuve suffisante lorsqu’une source conteste plus tard ce qu’elle a publié. Conservez l’enregistrement exactement tel que le serveur l’a renvoyé, ainsi que le contexte nécessaire pour montrer d’où et quand il provient. La fonction ci-dessous sauvegarde le corps de la réponse sans modification, nommé selon son hash SHA-256, et ajoute une ligne de journal avec l’URL, le statut, l’heure et le hash :

import hashlib
import json
from datetime import datetime, timezone
from pathlib import Path

import requests


def capture(url, folder, session=None, note=""):
    """Save a public record exactly as served, with a hash and the context needed to verify it later."""
    session = session or requests.Session()
    response = session.get(url, timeout=30)
    body = response.content
    digest = hashlib.sha256(body).hexdigest()
    retrieved = datetime.now(timezone.utc).isoformat(timespec="seconds")
    folder = Path(folder)
    folder.mkdir(parents=True, exist_ok=True)
    (folder / f"{digest}.body").write_bytes(body)
    record = {
        "requested_url": url,
        "final_url": response.url,
        "status": response.status_code,
        "retrieved_utc": retrieved,
        "sha256": digest,
        "bytes": len(body),
        "content_type": response.headers.get("content-type", ""),
        "last_modified": response.headers.get("last-modified"),
        "note": note,
    }
    with open(folder / "log.jsonl", "a", encoding="utf-8") as log:
        log.write(json.dumps(record) + "\n")
    return record

Utilisée sur une page publique d’entreprise du registre britannique :

import requests

from capture import capture

session = requests.Session()
session.headers["User-Agent"] = "ExampleNewsroom/1.0 (+https://example.org/research)"

record = capture("https://find-and-update.company-information.service.gov.uk/company/00445790",
                 "records", session, note="registered office check")
print(record["status"], record["sha256"], record["retrieved_utc"])

Deux captures de cette page à dix secondes d’intervalle ont produit le même hash, ce qui est précisément l’intérêt : si un enregistrement n’a pas changé, n’importe qui peut le confirmer octet par octet, et s’il change, le hash montre exactement à quel moment. Pour des collectes plus importantes, le format WARC décrit dans conserver la réponse brute stocke les requêtes et les réponses ensemble avec des outils standards, et des preuves recevables en justice à partir d’annonces en ligne couvre les étapes supplémentaires lorsque le matériel peut finir dans une procédure judiciaire. Une capture dans une archive web publique, faite au même moment, ajoute une corroboration indépendante.

Enregistrez également d’où la collecte a été effectuée. Certains portails affichent un contenu ou une langue différents selon la localisation du visiteur, et noter le point d’observation, comme le soutient l’argumentaire pour une norme de point d’observation, permet à d’autres de reproduire ce que vous avez vu.

Vérifiez avant de publier

Les registres publics sont souvent erronés, obsolètes ou ambigus. Les registres consignent ce qui a été déposé, pas ce qui est vrai ; les noms sont réutilisés ; les adresses sont partagées par de nombreuses sociétés enregistrées via le même agent de constitution. La vérification transforme un enregistrement en conclusion :

VérificationContre quoi elle protège
Confirmer auprès de l’organisme émetteur ou d’une seconde source officielleErreurs de transcription et entrées obsolètes
Faire correspondre sur des identifiants, pas des nomsPersonnes ou sociétés différentes portant le même nom
Vérifier les dates et versionsDépôts modifiés, enregistrements remplacés, confusion de fuseau horaire
Chercher des explications innocentesAdresses d’agents de constitution, dirigeants nominaux, dépôts de routine
Interroger le sujet avant publicationContexte que les registres ne montrent pas, et équité
Conserver la chaîne entre l’affirmation et l’enregistrementChaque déclaration publiée reliée à un enregistrement préservé et hashé

La dernière ligne est la discipline la plus importante. Chaque affirmation factuelle d’un article doit renvoyer à un enregistrement préservé précis, et n’importe qui dans l’équipe doit pouvoir l’ouvrir et voir ce qu’il disait le jour de sa collecte.

Éthique

Collecter des registres publics soulève les mêmes questions éthiques que tout travail journalistique. Le code de déontologie de la Society of Professional Journalists les organise selon quatre principes : rechercher la vérité et la rapporter, minimiser le préjudice, agir indépendamment, et rendre des comptes et être transparent. Plusieurs s’appliquent avec une force particulière à la collecte en masse :

  • Public n’équivaut pas à inoffensif. Les registres contiennent des adresses personnelles, des dates de naissance et des détails familiaux. Ne collectez que ce dont l’article a besoin, restreignez l’accès au reste, et réfléchissez bien avant de publier des détails personnels de personnes qui ne sont pas le sujet.
  • L’agrégation crée de l’information nouvelle. Combiner des enregistrements peut révéler des choses qu’aucun enregistrement isolé ne révèle, ce qui est souvent l’objectif de l’enquête et aussi le risque. Pesez l’intérêt public de ce que révèle la combinaison.
  • Collectez avec respect. Les services publics sont financés par le public. Utilisez les données en masse lorsqu’elles existent, modérez le rythme de collecte, identifiez honnêtement votre collecteur, et ne contournez pas les contrôles d’accès.
  • Tenez compte du droit en vigueur là où vous travaillez. Les règles de protection des données, de droit d’auteur et d’usage abusif des systèmes informatiques s’appliquent aussi aux journalistes, et de nombreuses juridictions prévoient des exemptions spécifiques pour le journalisme ou la recherche, avec leurs propres conditions. Nos synthèses sur la légalité du web scraping et le RGPD et la collecte de données constituent un point de départ ; consultez le service juridique de votre rédaction pour des projets spécifiques.

En résumé

Les registres publics sont l’une des sources les plus puissantes dont dispose une enquête, et l’une des plus faciles à mal utiliser. Commencez par les données en masse et les API officielles, collectez selon un plan écrit, préservez chaque enregistrement exactement tel que servi avec un hash et un horodatage, vérifiez chaque conclusion auprès d’une seconde source et du sujet concerné, et limitez les données personnelles à ce dont l’article a besoin.

Le résultat est un journalisme qui tient debout : chaque affirmation traçable jusqu’à un enregistrement que n’importe qui peut vérifier, collecté d’une manière que la rédaction peut expliquer.

Sources et références

Prêt à commencer ?

Essayez les proxies résidentiels de Shifter, 205M+ IPs, 195+ pays, à partir de 0,75 $/GB.

Commencer