La plupart des bases de données de leads B2B échouent de deux façons, et aucune n’est un échec de scraping. Elles se dégradent, parce que les gens changent d’emploi et les entreprises changent de forme plus vite que quiconque ne rafraîchit les enregistrements. Ou elles deviennent un risque, parce que personne ne peut dire d’où vient un contact, sur quelle base il est conservé, ou si cette personne a demandé à être retirée.
Ces deux échecs sont des décisions de conception prises dès le premier jour. Ce guide traite de la construction d’une base de données de leads à partir de sources publiques, de manière à ce qu’elle reste exacte et défendable. L’argumentaire sur l’importance de l’infrastructure proxy pour la génération de leads se trouve dans les proxies résidentiels pour la génération de leads B2B. Ceci est la construction.
Partir du profil client idéal, pas du scraper
Le profil client idéal détermine quelles sources comptent, quels champs il vous faut et quelle taille la base de données doit avoir. Rédigez-le avant que toute collecte ne commence : secteurs, tranches de taille, régions, modèles économiques, et les signaux observables qui indiquent une bonne adéquation.
Un profil clair permet de garder une base de données petite et pertinente. Un profil vague produit une grande base de données d’entreprises à qui personne ne vendra jamais, mais qui portent toutes les mêmes obligations de conformité que celles auxquelles vous vendez réellement.
Construire d’abord l’univers des comptes
Les entreprises sont la couche stable. Construisez-les avant tout contact, à partir de sources qui décrivent des organisations plutôt que des personnes.
| Source | Ce qu’elle vous apporte | Notes |
|---|---|---|
| Registres d’entreprises | Nom légal, numéro d’enregistrement, statut, adresse enregistrée | Faisant autorité ; beaucoup proposent des fichiers en masse ou des API |
| Annuaires sectoriels et associatifs | Listes de membres par secteur et région | Souvent paginés et à débit limité |
| Listes d’exposants et de sponsors de conférences | Entreprises investissant dans votre catégorie | Limitées dans le temps et très pertinentes |
| Annuaires de marketplaces et de partenaires | Entreprises s’intégrant à une plateforme donnée | Signal technographique fort |
| Sites web d’entreprises | Produits, sites, tarifs, clients | La source la plus riche, et la plus variée |
| Offres d’emploi | Croissance, structure d’équipe, outils utilisés | Un signal avancé ; voir les données de sites d’offres d’emploi |
Là où un registre ou un annuaire publie des données en masse ou une API, utilisez-la. Ne scrapez que ce qui n’est proposé par aucun autre moyen.
Résoudre l’identité de l’entreprise avant tout le reste
La même entreprise apparaît sous un nom légal, un nom commercial, plusieurs domaines, et en tant que société mère et filiales. Si l’identité n’est pas résolue, la base de données se remplit de doublons, et chaque décompte en aval est gonflé.
Utilisez le domaine web principal comme clé de travail, car c’est l’identifiant que la plupart des sources partagent. Normalisez les noms légaux en supprimant les suffixes et la ponctuation, associez les identifiants de registre là où vous les avez, et modélisez explicitement les relations mère-filiale plutôt que de les fusionner. Mesurez le taux de doublons sur un échantillon vérifié manuellement et gardez-le visible.
Données firmographiques et signaux, chacun avec une source
Pour chaque champ d’entreprise, stockez trois choses : la valeur, sa provenance, et la date à laquelle elle a été observée. Le secteur, la tranche de taille, les sites, les indicateurs technologiques et l’activité de recrutement changent tous, et une valeur sans date ne peut plus être fiable six mois plus tard.
Des signaux comme les pics de recrutement ou les lancements de nouveaux produits sont des événements plutôt que des attributs, et ils perdent rapidement de leur valeur. L’argumentaire pour les traiter ainsi se trouve dans le scraping de signaux d’intention pour alimenter le sales intelligence.
La couche contact : les rôles d’abord, les personnes ensuite
Les contacts sont l’endroit où se concentrent à la fois la dégradation et le risque de conformité, donc ajoutez-les en dernier et avec précaution.
Modélisez les rôles avant les personnes. « Responsable de l’ingénierie des données dans cette entreprise » reste vrai bien après que la personne qui l’occupait soit partie. Stockez le rôle comme l’enregistrement durable et rattachez-y la personne actuelle comme une observation avec une date. Le même principe est exposé dans la construction de données de talent-mapping et d’organigrammes.
Restez dans le contexte professionnel. Nom, rôle, entreprise et un email professionnel ou un téléphone professionnel publiés dans un contexte professionnel. Les adresses email personnelles, les numéros de téléphone personnels, les adresses domiciliaires et les profils sociaux sans rapport avec le travail n’ont pas leur place dans une base de données B2B.
Ne collectez que ce qui est public, et uniquement là où vous y êtes autorisé. Ne scrapez pas de contenu derrière une connexion, et respectez les conditions d’utilisation de chaque source.
Ne sondez pas les serveurs de messagerie pour deviner des adresses. Générer des adresses probables et les tester contre le serveur de messagerie d’une entreprise est largement considéré comme abusif, nuit à votre réputation d’envoi, et n’apporte rien de défendable. Si vous avez besoin d’adresses vérifiées, utilisez un service de vérification que vous avez évalué, ou appuyez-vous sur des adresses que les gens ont eux-mêmes publiées.
Intégrer la conformité dans le schéma
La conformité qui vit dans un document de politique et non dans le modèle de données ne survit pas au contact avec une base de données réelle. Mettez-la dans les tables.
| Champ | Objectif |
|---|---|
| URL source et type de source | Prouve d’où vient chaque valeur |
| Collecté le | Soutient les décisions de fraîcheur et de rétention |
| Référence de base légale | Relie l’enregistrement à la base documentée justifiant sa conservation |
| Finalité | Limite l’usage à ce que couvre la base |
| Juridiction, si connue | Détermine quelles règles s’appliquent à la prospection |
| Statut de notification | Enregistre si et quand la personne a été informée |
| Expiration de la rétention | Force une révision ou une suppression |
| Indicateur de suppression | Arrête tout traitement et toute prospection ultérieurs |
Quelques points de droit façonnent ces champs. Ils sont généraux, et vous devriez consulter vos propres conseils juridiques.
- Les coordonnées professionnelles sont des données personnelles. Selon le RGPD, l’email professionnel d’une personne nommée reste une donnée personnelle, et le règlement s’applique.
- L’intérêt légitime doit être documenté. C’est la base habituelle pour la prospection B2B, et elle nécessite une évaluation de mise en balance écrite, pas une supposition.
- Les personnes doivent être informées. Lorsque vous obtenez les données d’une personne à partir de sources autres qu’elle-même, le RGPD exige généralement de l’en informer, au plus tard au premier contact lorsque vous l’utilisez pour communiquer.
- La Californie n’exempte plus les données B2B. Depuis 2023, les coordonnées professionnelles entrent dans le champ d’application de la loi californienne sur la vie privée.
- Les règles de prospection varient. Les règles concernant les emails non sollicités aux adresses professionnelles diffèrent selon les pays, et certains exigent un consentement préalable même pour le B2B. Les règles américaines sur les emails commerciaux exigent une option de désinscription fonctionnelle.
La liste de suppression est permanente et globale. Lorsqu’une personne se désinscrit ou demande à être supprimée, retirez-la de chaque table dérivée, cache et export, et conservez un enregistrement minimal qui empêche sa recollecte. Une suppression annulée par le crawl suivant n’en est pas une.
Le cadre plus large est présenté dans les proxies résidentiels et la conformité RGPD.
Collecter à grande échelle
Différentes sources évoluent à des vitesses différentes, donnez donc à chacune sa propre cadence plutôt qu’un crawl global unique.
| Source | Cadence typique |
|---|---|
| Registres | Mensuelle, ou selon leur propre calendrier de publication |
| Annuaires et listes associatives | Hebdomadaire à mensuelle |
| Sites web d’entreprises | Mensuelle, avec détection de changement |
| Offres d’emploi | Quotidienne |
| Listes d’événements | Lors de la publication, puis figée |
Les annuaires sont généralement paginés et limités en débit. Maintenez une seule sortie sur l’ensemble d’un parcours pour que la pagination reste cohérente, et effectuez une rotation pour les récupérations de pages indépendantes. Avec la passerelle Shifter, les deux se configurent dans les identifiants face à p.shifter.io:443 :
customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD
Les annuaires et registres régionaux servent souvent un contenu différent selon la localisation, donc collectez chaque région depuis cette région. Gardez des taux de requête ordinaires et reculez en cas d’erreurs, comme dans la limitation de débit et le throttling des requêtes. Pour les annuaires qui chargent les résultats en JavaScript, une requête rendue est souvent plus simple que de faire tourner vos propres navigateurs ; voir quand vous avez besoin d’une API de web scraping.
La fraîcheur est un processus
Une base de données de leads se dégrade continuellement. Intégrez le rafraîchissement dans les opérations plutôt que de planifier un nettoyage annuel.
- Revérifiez les contacts selon un calendrier, et marquez comme obsolète tout lien personne-rôle plus ancien que votre seuil.
- Recrawlez les sources d’entreprises selon leur cadence, et enregistrez ce qui a changé.
- Réinjectez les résultats de prospection. Les rebonds, les désinscriptions et les réponses « n’est plus ici » sont le signal de fraîcheur le plus précis que vous obtiendrez, et ils doivent mettre à jour la base de données, pas seulement l’outil de prospection.
Mesurer la base de données
| Métrique | Ce qu’elle vous indique |
|---|---|
| Couverture du profil client idéal | Si la base de données contient le marché auquel vous vendez |
| Taux de doublons | Si la résolution d’identité fonctionne |
| Complétude des champs | Où les sources sont faibles |
| Distribution de l’obsolescence | Quelle part des données a dépassé son seuil de rafraîchissement |
| Taux de rebond et de désinscription | Exactitude réelle et santé du consentement |
| Occurrences de suppression pendant la collecte | Si des personnes supprimées sont recollectées |
FAQ
Est-il légal de scraper des données de contact B2B ?
Cela peut l’être, lorsque les données sont publiques, à contexte purement professionnel, conservées sur une base légale documentée, et traitées avec transparence et options de désinscription. La réponse dépend de la juridiction et de l’usage, faites donc intervenir un conseil juridique.
Pouvons-nous scraper des plateformes de réseautage professionnel ?
Pas derrière une connexion, et pas contre leurs conditions d’utilisation. Construisez plutôt à partir de sites d’entreprises, de registres et d’annuaires.
Devrions-nous acheter des données plutôt que les construire ?
Les données sous licence complètent bien une construction. Les obligations de conformité concernant leur usage vous incombent toujours.
À quelle fréquence les contacts doivent-ils être revérifiés ?
Assez souvent pour que la part obsolète reste faible. Beaucoup d’équipes revérifient trimestriellement les comptes cibles actifs et laissent les retours de prospection signaler le reste.
L’essentiel
Une base de données de leads B2B qui dure est d’abord un modèle de comptes, ensuite une liste de contacts. Construisez les entreprises à partir de sources faisant autorité, résolvez leur identité, stockez chaque valeur avec sa source et sa date, rattachez les contacts au niveau du rôle avec des données à contexte purement professionnel, et intégrez la base légale, la notification, la rétention et la suppression dans le schéma plutôt que dans une politique.
Collectez chaque source à sa propre cadence, maintenez le rafraîchissement en continu, et réinjectez les résultats de prospection dans les données. La vue produit se trouve sur la page collecte de données pour la génération de leads, et le volet enrichissement est traité dans l’enrichissement de contacts et d’entreprises.