Scraping

Créer une base de leads B2B par web scraping (conforme et à grande échelle)

Une base de leads est un modèle de comptes avec des contacts associés, pas une liste d'e-mails. Comment en construire une à partir de sources publiques avec la conformité intégrée au schéma.

Chris Collins

Chris Collins

17 septembre 2026 · 10 min de lecture

La plupart des bases de données de leads B2B échouent de deux façons, et aucune n’est un échec de scraping. Elles se dégradent, parce que les gens changent d’emploi et les entreprises changent de forme plus vite que quiconque ne rafraîchit les enregistrements. Ou elles deviennent un risque, parce que personne ne peut dire d’où vient un contact, sur quelle base il est conservé, ou si cette personne a demandé à être retirée.

Ces deux échecs sont des décisions de conception prises dès le premier jour. Ce guide traite de la construction d’une base de données de leads à partir de sources publiques, de manière à ce qu’elle reste exacte et défendable. L’argumentaire sur l’importance de l’infrastructure proxy pour la génération de leads se trouve dans les proxies résidentiels pour la génération de leads B2B. Ceci est la construction.

Partir du profil client idéal, pas du scraper

Le profil client idéal détermine quelles sources comptent, quels champs il vous faut et quelle taille la base de données doit avoir. Rédigez-le avant que toute collecte ne commence : secteurs, tranches de taille, régions, modèles économiques, et les signaux observables qui indiquent une bonne adéquation.

Un profil clair permet de garder une base de données petite et pertinente. Un profil vague produit une grande base de données d’entreprises à qui personne ne vendra jamais, mais qui portent toutes les mêmes obligations de conformité que celles auxquelles vous vendez réellement.

Construire d’abord l’univers des comptes

Les entreprises sont la couche stable. Construisez-les avant tout contact, à partir de sources qui décrivent des organisations plutôt que des personnes.

SourceCe qu’elle vous apporteNotes
Registres d’entreprisesNom légal, numéro d’enregistrement, statut, adresse enregistréeFaisant autorité ; beaucoup proposent des fichiers en masse ou des API
Annuaires sectoriels et associatifsListes de membres par secteur et régionSouvent paginés et à débit limité
Listes d’exposants et de sponsors de conférencesEntreprises investissant dans votre catégorieLimitées dans le temps et très pertinentes
Annuaires de marketplaces et de partenairesEntreprises s’intégrant à une plateforme donnéeSignal technographique fort
Sites web d’entreprisesProduits, sites, tarifs, clientsLa source la plus riche, et la plus variée
Offres d’emploiCroissance, structure d’équipe, outils utilisésUn signal avancé ; voir les données de sites d’offres d’emploi

Là où un registre ou un annuaire publie des données en masse ou une API, utilisez-la. Ne scrapez que ce qui n’est proposé par aucun autre moyen.

Résoudre l’identité de l’entreprise avant tout le reste

La même entreprise apparaît sous un nom légal, un nom commercial, plusieurs domaines, et en tant que société mère et filiales. Si l’identité n’est pas résolue, la base de données se remplit de doublons, et chaque décompte en aval est gonflé.

Utilisez le domaine web principal comme clé de travail, car c’est l’identifiant que la plupart des sources partagent. Normalisez les noms légaux en supprimant les suffixes et la ponctuation, associez les identifiants de registre là où vous les avez, et modélisez explicitement les relations mère-filiale plutôt que de les fusionner. Mesurez le taux de doublons sur un échantillon vérifié manuellement et gardez-le visible.

Données firmographiques et signaux, chacun avec une source

Pour chaque champ d’entreprise, stockez trois choses : la valeur, sa provenance, et la date à laquelle elle a été observée. Le secteur, la tranche de taille, les sites, les indicateurs technologiques et l’activité de recrutement changent tous, et une valeur sans date ne peut plus être fiable six mois plus tard.

Des signaux comme les pics de recrutement ou les lancements de nouveaux produits sont des événements plutôt que des attributs, et ils perdent rapidement de leur valeur. L’argumentaire pour les traiter ainsi se trouve dans le scraping de signaux d’intention pour alimenter le sales intelligence.

La couche contact : les rôles d’abord, les personnes ensuite

Les contacts sont l’endroit où se concentrent à la fois la dégradation et le risque de conformité, donc ajoutez-les en dernier et avec précaution.

Modélisez les rôles avant les personnes. « Responsable de l’ingénierie des données dans cette entreprise » reste vrai bien après que la personne qui l’occupait soit partie. Stockez le rôle comme l’enregistrement durable et rattachez-y la personne actuelle comme une observation avec une date. Le même principe est exposé dans la construction de données de talent-mapping et d’organigrammes.

Restez dans le contexte professionnel. Nom, rôle, entreprise et un email professionnel ou un téléphone professionnel publiés dans un contexte professionnel. Les adresses email personnelles, les numéros de téléphone personnels, les adresses domiciliaires et les profils sociaux sans rapport avec le travail n’ont pas leur place dans une base de données B2B.

Ne collectez que ce qui est public, et uniquement là où vous y êtes autorisé. Ne scrapez pas de contenu derrière une connexion, et respectez les conditions d’utilisation de chaque source.

Ne sondez pas les serveurs de messagerie pour deviner des adresses. Générer des adresses probables et les tester contre le serveur de messagerie d’une entreprise est largement considéré comme abusif, nuit à votre réputation d’envoi, et n’apporte rien de défendable. Si vous avez besoin d’adresses vérifiées, utilisez un service de vérification que vous avez évalué, ou appuyez-vous sur des adresses que les gens ont eux-mêmes publiées.

Intégrer la conformité dans le schéma

La conformité qui vit dans un document de politique et non dans le modèle de données ne survit pas au contact avec une base de données réelle. Mettez-la dans les tables.

ChampObjectif
URL source et type de sourceProuve d’où vient chaque valeur
Collecté leSoutient les décisions de fraîcheur et de rétention
Référence de base légaleRelie l’enregistrement à la base documentée justifiant sa conservation
FinalitéLimite l’usage à ce que couvre la base
Juridiction, si connueDétermine quelles règles s’appliquent à la prospection
Statut de notificationEnregistre si et quand la personne a été informée
Expiration de la rétentionForce une révision ou une suppression
Indicateur de suppressionArrête tout traitement et toute prospection ultérieurs

Quelques points de droit façonnent ces champs. Ils sont généraux, et vous devriez consulter vos propres conseils juridiques.

  • Les coordonnées professionnelles sont des données personnelles. Selon le RGPD, l’email professionnel d’une personne nommée reste une donnée personnelle, et le règlement s’applique.
  • L’intérêt légitime doit être documenté. C’est la base habituelle pour la prospection B2B, et elle nécessite une évaluation de mise en balance écrite, pas une supposition.
  • Les personnes doivent être informées. Lorsque vous obtenez les données d’une personne à partir de sources autres qu’elle-même, le RGPD exige généralement de l’en informer, au plus tard au premier contact lorsque vous l’utilisez pour communiquer.
  • La Californie n’exempte plus les données B2B. Depuis 2023, les coordonnées professionnelles entrent dans le champ d’application de la loi californienne sur la vie privée.
  • Les règles de prospection varient. Les règles concernant les emails non sollicités aux adresses professionnelles diffèrent selon les pays, et certains exigent un consentement préalable même pour le B2B. Les règles américaines sur les emails commerciaux exigent une option de désinscription fonctionnelle.

La liste de suppression est permanente et globale. Lorsqu’une personne se désinscrit ou demande à être supprimée, retirez-la de chaque table dérivée, cache et export, et conservez un enregistrement minimal qui empêche sa recollecte. Une suppression annulée par le crawl suivant n’en est pas une.

Le cadre plus large est présenté dans les proxies résidentiels et la conformité RGPD.

Collecter à grande échelle

Différentes sources évoluent à des vitesses différentes, donnez donc à chacune sa propre cadence plutôt qu’un crawl global unique.

SourceCadence typique
RegistresMensuelle, ou selon leur propre calendrier de publication
Annuaires et listes associativesHebdomadaire à mensuelle
Sites web d’entreprisesMensuelle, avec détection de changement
Offres d’emploiQuotidienne
Listes d’événementsLors de la publication, puis figée

Les annuaires sont généralement paginés et limités en débit. Maintenez une seule sortie sur l’ensemble d’un parcours pour que la pagination reste cohérente, et effectuez une rotation pour les récupérations de pages indépendantes. Avec la passerelle Shifter, les deux se configurent dans les identifiants face à p.shifter.io:443 :

customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD

Les annuaires et registres régionaux servent souvent un contenu différent selon la localisation, donc collectez chaque région depuis cette région. Gardez des taux de requête ordinaires et reculez en cas d’erreurs, comme dans la limitation de débit et le throttling des requêtes. Pour les annuaires qui chargent les résultats en JavaScript, une requête rendue est souvent plus simple que de faire tourner vos propres navigateurs ; voir quand vous avez besoin d’une API de web scraping.

La fraîcheur est un processus

Une base de données de leads se dégrade continuellement. Intégrez le rafraîchissement dans les opérations plutôt que de planifier un nettoyage annuel.

  • Revérifiez les contacts selon un calendrier, et marquez comme obsolète tout lien personne-rôle plus ancien que votre seuil.
  • Recrawlez les sources d’entreprises selon leur cadence, et enregistrez ce qui a changé.
  • Réinjectez les résultats de prospection. Les rebonds, les désinscriptions et les réponses « n’est plus ici » sont le signal de fraîcheur le plus précis que vous obtiendrez, et ils doivent mettre à jour la base de données, pas seulement l’outil de prospection.

Mesurer la base de données

MétriqueCe qu’elle vous indique
Couverture du profil client idéalSi la base de données contient le marché auquel vous vendez
Taux de doublonsSi la résolution d’identité fonctionne
Complétude des champsOù les sources sont faibles
Distribution de l’obsolescenceQuelle part des données a dépassé son seuil de rafraîchissement
Taux de rebond et de désinscriptionExactitude réelle et santé du consentement
Occurrences de suppression pendant la collecteSi des personnes supprimées sont recollectées

FAQ

Est-il légal de scraper des données de contact B2B ?

Cela peut l’être, lorsque les données sont publiques, à contexte purement professionnel, conservées sur une base légale documentée, et traitées avec transparence et options de désinscription. La réponse dépend de la juridiction et de l’usage, faites donc intervenir un conseil juridique.

Pouvons-nous scraper des plateformes de réseautage professionnel ?

Pas derrière une connexion, et pas contre leurs conditions d’utilisation. Construisez plutôt à partir de sites d’entreprises, de registres et d’annuaires.

Devrions-nous acheter des données plutôt que les construire ?

Les données sous licence complètent bien une construction. Les obligations de conformité concernant leur usage vous incombent toujours.

À quelle fréquence les contacts doivent-ils être revérifiés ?

Assez souvent pour que la part obsolète reste faible. Beaucoup d’équipes revérifient trimestriellement les comptes cibles actifs et laissent les retours de prospection signaler le reste.

L’essentiel

Une base de données de leads B2B qui dure est d’abord un modèle de comptes, ensuite une liste de contacts. Construisez les entreprises à partir de sources faisant autorité, résolvez leur identité, stockez chaque valeur avec sa source et sa date, rattachez les contacts au niveau du rôle avec des données à contexte purement professionnel, et intégrez la base légale, la notification, la rétention et la suppression dans le schéma plutôt que dans une politique.

Collectez chaque source à sa propre cadence, maintenez le rafraîchissement en continu, et réinjectez les résultats de prospection dans les données. La vue produit se trouve sur la page collecte de données pour la génération de leads, et le volet enrichissement est traité dans l’enrichissement de contacts et d’entreprises.

Prêt à commencer ?

Essayez les proxies résidentiels de Shifter, 205M+ IPs, 195+ pays, à partir de 0,75 $/GB.

Commencer