Die meisten B2B-Lead-Datenbanken scheitern auf eine von zwei Arten, und keine davon ist ein Scraping-Fehler. Sie verfallen, weil Menschen den Job wechseln und Unternehmen sich schneller verändern, als jemand die Datensätze aktualisiert. Oder sie werden zu einem Risiko, weil niemand sagen kann, woher ein Kontakt stammt, auf welcher Grundlage er gespeichert wird, oder ob diese Person um Entfernung gebeten hat.
Beide Fehler sind Design-Entscheidungen, die am ersten Tag getroffen werden. Dieser Leitfaden beschreibt den Aufbau einer Lead-Datenbank aus öffentlichen Quellen, sodass sie genau und verteidigungsfähig bleibt. Die Begründung, warum Proxy-Infrastruktur für die Leadgenerierung überhaupt wichtig ist, steht in residential proxies for B2B lead generation. Dies ist der Aufbau.
Beginnen Sie mit dem idealen Kundenprofil, nicht mit dem Scraper
Das ideale Kundenprofil entscheidet, welche Quellen wichtig sind, welche Felder Sie benötigen und wie groß die Datenbank sein sollte. Schreiben Sie es auf, bevor irgendeine Sammlung beginnt: Branchen, Größenklassen, Regionen, Geschäftsmodelle und die beobachtbaren Signale, die auf eine Passung hindeuten.
Ein klares Profil hält die Datenbank klein und relevant. Ein vages Profil erzeugt eine große Datenbank von Unternehmen, an die niemand jemals verkaufen wird, die aber alle dieselben Compliance-Pflichten mit sich bringen wie die, an die Sie tatsächlich verkaufen.
Bauen Sie zuerst das Unternehmensuniversum auf
Unternehmen sind die stabile Schicht. Bauen Sie sie vor allen Kontakten auf, aus Quellen, die Organisationen beschreiben, nicht Menschen.
| Quelle | Was sie liefert | Anmerkungen |
|---|---|---|
| Handelsregister | Rechtlicher Name, Registrierungsnummer, Status, eingetragene Adresse | Maßgeblich; viele bieten Massendaten oder APIs an |
| Branchen- und Verbandsverzeichnisse | Mitgliederlisten nach Sektor und Region | Oft paginiert und ratenbegrenzt |
| Aussteller- und Sponsorenlisten von Konferenzen | Unternehmen, die in Ihre Kategorie investieren | Zeitlich begrenzt und hochrelevant |
| Marktplatz- und Partnerverzeichnisse | Unternehmen, die mit einer bestimmten Plattform integrieren | Starkes technografisches Signal |
| Unternehmenswebsites | Produkte, Standorte, Preise, Kunden | Die reichhaltigste Quelle, und die vielfältigste |
| Stellenausschreibungen | Wachstum, Teamstruktur, verwendete Tools | Ein Frühindikator; siehe job-board data |
Wo ein Register oder Verzeichnis Massendaten oder eine API veröffentlicht, nutzen Sie diese. Scrapen Sie nur, was auf keine andere Weise angeboten wird.
Klären Sie die Unternehmensidentität, bevor irgendetwas anderes passiert
Dasselbe Unternehmen erscheint unter einem rechtlichen Namen, einem Handelsnamen, mehreren Domains und als Mutter- und Tochtergesellschaften. Wird die Identität nicht geklärt, füllt sich die Datenbank mit Duplikaten, und jede nachgelagerte Zählung wird verzerrt.
Verwenden Sie die primäre Web-Domain als Arbeitsschlüssel, da sie der Identifikator ist, den die meisten Quellen gemeinsam haben. Normalisieren Sie rechtliche Namen, indem Sie Suffixe und Interpunktion entfernen, verknüpfen Sie Registrierungskennungen, wo Sie diese haben, und modellieren Sie Mutter- und Tochterbeziehungen explizit, anstatt sie zusammenzuführen. Messen Sie die Duplikatsrate an einer manuell geprüften Stichprobe und behalten Sie diese im Blick.
Firmografische Daten und Signale, jedes mit einer Quelle
Speichern Sie für jedes Unternehmensfeld drei Dinge: den Wert, woher er stammt, und wann er beobachtet wurde. Branche, Größenklasse, Standorte, technologische Indikatoren und Einstellungsaktivität ändern sich alle, und ein Wert ohne Datum kann sechs Monate später nicht mehr vertraut werden.
Signale wie Einstellungsspitzen oder neue Produkteinführungen sind Ereignisse und keine Attribute, und sie verlieren schnell an Wert. Die Begründung dafür, sie so zu behandeln, steht in scraping intent signals to power sales intelligence.
Die Kontaktebene: zuerst Rollen, dann Menschen
Kontakte sind der Punkt, an dem sich sowohl Verfall als auch Compliance-Risiko konzentrieren, also fügen Sie sie zuletzt und mit Sorgfalt hinzu.
Modellieren Sie Rollen vor Menschen. „Head of Data Engineering bei diesem Unternehmen” bleibt lange wahr, nachdem die Person, die diese Rolle innehat, weitergezogen ist. Speichern Sie die Rolle als den dauerhaften Datensatz und verknüpfen Sie die aktuelle Person als Beobachtung mit einem Datum. Dasselbe Prinzip wird in building talent-mapping and org-chart data dargelegt.
Bleiben Sie im geschäftlichen Kontext. Name, Rolle, Unternehmen und eine geschäftliche E-Mail-Adresse oder Telefonnummer, die in einem beruflichen Kontext veröffentlicht wurden. Private E-Mail-Adressen, private Telefonnummern, Privatadressen und Social-Media-Profile ohne Bezug zur Arbeit gehören nicht in eine B2B-Datenbank.
Sammeln Sie nur, was öffentlich ist, und nur dort, wo es Ihnen erlaubt ist. Scrapen Sie keine Inhalte hinter einem Login und respektieren Sie die Nutzungsbedingungen jeder Quelle.
Testen Sie keine Mailserver, um Adressen zu erraten. Das Generieren wahrscheinlicher Adressen und deren Testen gegen den Mailserver eines Unternehmens gilt weithin als missbräuchlich, schädigt Ihren Versandruf und bringt nichts, was Sie verteidigen könnten. Wenn Sie verifizierte Adressen benötigen, nutzen Sie einen geprüften Verifizierungsdienst oder verlassen Sie sich auf Adressen, die Personen selbst veröffentlicht haben.
Compliance ins Schema einbauen
Compliance, die nur in einem Richtliniendokument existiert und nicht im Datenmodell, übersteht den Kontakt mit einer echten Datenbank nicht. Bringen Sie sie in die Tabellen.
| Feld | Zweck |
|---|---|
| Quell-URL und Quellentyp | Belegt, woher jeder Wert stammt |
| Erfasst am | Unterstützt Entscheidungen zu Aktualität und Aufbewahrung |
| Verweis auf die Rechtsgrundlage | Verknüpft den Datensatz mit der dokumentierten Grundlage für dessen Speicherung |
| Zweck | Beschränkt die Nutzung auf das, was die Grundlage abdeckt |
| Jurisdiktion, sofern bekannt | Bestimmt, welche Regeln für Outreach gelten |
| Hinweisstatus | Vermerkt, ob und wann die Person informiert wurde |
| Ablauf der Aufbewahrung | Erzwingt Überprüfung oder Löschung |
| Sperrvermerk | Stoppt jede weitere Verarbeitung und jeden Outreach |
Einige rechtliche Punkte prägen diese Felder. Sie sind allgemein gehalten, und Sie sollten sich mit Ihrer eigenen Rechtsberatung abstimmen.
- Geschäftliche Kontaktdaten sind personenbezogene Daten. Unter der DSGVO ist die geschäftliche E-Mail-Adresse einer namentlich genannten Person weiterhin personenbezogen, und die Verordnung gilt.
- Berechtigtes Interesse muss dokumentiert werden. Es ist die übliche Grundlage für B2B-Prospecting, und es erfordert eine schriftliche Abwägungsprüfung, keine Annahme.
- Personen müssen informiert werden. Wenn Sie die Daten einer Person aus anderen Quellen als von ihr selbst erhalten, verlangt die DSGVO im Allgemeinen, sie zu informieren, spätestens beim ersten Kontakt, wenn Sie die Daten zur Kommunikation nutzen.
- Kalifornien nimmt B2B-Daten nicht mehr aus. Seit 2023 fallen geschäftliche Kontaktinformationen unter das kalifornische Datenschutzgesetz.
- Outreach-Regeln variieren. Regeln für unaufgeforderte E-Mails an geschäftliche Adressen unterscheiden sich je nach Land, und manche verlangen vorherige Zustimmung selbst bei B2B. US-amerikanische Regeln für kommerzielle E-Mails erfordern eine funktionierende Abmeldemöglichkeit.
Die Sperrliste ist dauerhaft und global. Wenn jemand widerspricht oder um Löschung bittet, entfernen Sie diese Person aus jeder abgeleiteten Tabelle, jedem Cache und jedem Export, und behalten Sie einen minimalen Eintrag, der die erneute Erfassung verhindert. Eine Sperre, die durch den nächsten Crawl aufgehoben wird, ist keine Sperre.
Die breitere Einordnung findet sich in residential proxies and GDPR compliance.
Sammeln im großen Maßstab
Verschiedene Quellen bewegen sich mit unterschiedlicher Geschwindigkeit, geben Sie also jeder ihren eigenen Rhythmus statt eines globalen Crawls.
| Quelle | Typischer Rhythmus |
|---|---|
| Register | Monatlich, oder nach deren eigenem Veröffentlichungsplan |
| Verzeichnisse und Verbandslisten | Wöchentlich bis monatlich |
| Unternehmenswebsites | Monatlich, mit Änderungserkennung |
| Stellenausschreibungen | Täglich |
| Veranstaltungslisten | Bei Veröffentlichung, dann eingefroren |
Verzeichnisse sind meist paginiert und gedrosselt. Halten Sie einen Exit über einen kompletten Durchlauf konstant, damit die Paginierung stimmig bleibt, und rotieren Sie für unabhängige Seitenabrufe. Mit dem Shifter-Gateway werden beide in den Zugangsdaten gegen p.shifter.io:443 festgelegt:
customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD
Regionale Verzeichnisse und Register liefern oft je nach Standort unterschiedliche Ergebnisse, sammeln Sie also jede Region aus dieser Region. Halten Sie die Anfragerate normal und drosseln Sie bei Fehlern, wie in rate limiting and request throttling beschrieben. Für Verzeichnisse, die Ergebnisse per JavaScript laden, ist eine gerenderte Anfrage oft einfacher als eigene Browser zu betreiben; siehe when you need a web scraping API.
Aktualität ist ein Prozess
Eine Lead-Datenbank verfällt kontinuierlich. Bauen Sie die Aktualisierung in den Betrieb ein, statt eine jährliche Bereinigung anzusetzen.
- Verifizieren Sie Kontakte nach einem Zeitplan neu und markieren Sie jede Person-zu-Rolle-Verknüpfung, die älter als Ihr Schwellenwert ist, als veraltet.
- Crawlen Sie Unternehmensquellen erneut in ihrem Rhythmus und protokollieren Sie, was sich geändert hat.
- Speisen Sie Outreach-Ergebnisse zurück. Bounces, Abmeldungen und Antworten wie „nicht mehr hier” sind das genaueste Aktualitätssignal, das Sie erhalten werden, und sie müssen die Datenbank aktualisieren, nicht nur das Outreach-Tool.
Die Datenbank messen
| Metrik | Was sie Ihnen sagt |
|---|---|
| Abdeckung des idealen Kundenprofils | Ob die Datenbank den Markt enthält, an den Sie verkaufen |
| Duplikatsrate | Ob die Identitätsauflösung funktioniert |
| Feldvollständigkeit | Wo Quellen dünn sind |
| Verteilung der Veraltung | Wie viel der Daten den Aktualisierungsschwellenwert überschritten hat |
| Bounce- und Abmelderaten | Reale Genauigkeit und Zustimmungszustand |
| Sperrlisten-Treffer während der Sammlung | Ob gesperrte Personen erneut erfasst werden |
FAQ
Ist das Scrapen von B2B-Kontaktdaten legal?
Es kann sein, wenn die Daten öffentlich sind, nur geschäftlichen Kontext betreffen, auf einer dokumentierten Rechtsgrundlage gespeichert werden und mit Transparenz und Widerspruchsmöglichkeiten gehandhabt werden. Die Antwort hängt von Jurisdiktion und Verwendungszweck ab, ziehen Sie also Rechtsberatung hinzu.
Können wir professionelle Netzwerkplattformen scrapen?
Nicht hinter einem Login, und nicht gegen deren Nutzungsbedingungen. Bauen Sie stattdessen auf Unternehmenswebsites, Registern und Verzeichnissen auf.
Sollten wir Daten kaufen, statt sie selbst aufzubauen?
Lizenzierte Daten ergänzen einen eigenen Aufbau gut. Die Compliance-Pflichten für deren Nutzung liegen weiterhin bei Ihnen.
Wie oft sollten Kontakte neu verifiziert werden?
Oft genug, dass der veraltete Anteil klein bleibt. Viele Teams überprüfen aktive Zielunternehmen vierteljährlich erneut und lassen Outreach-Feedback den Rest kennzeichnen.
Fazit
Eine dauerhafte B2B-Lead-Datenbank ist zuerst ein Unternehmensmodell und erst danach eine Kontaktliste. Bauen Sie Unternehmen aus maßgeblichen Quellen auf, klären Sie deren Identität, speichern Sie jeden Wert mit seiner Quelle und seinem Datum, verknüpfen Sie Kontakte auf Rollenebene mit ausschließlich geschäftlichem Kontext, und bringen Sie Rechtsgrundlage, Hinweis, Aufbewahrung und Sperrung ins Schema statt in eine Richtlinie.
Sammeln Sie jede Quelle in ihrem eigenen Rhythmus, halten Sie die Aktualisierung kontinuierlich am Laufen, und speisen Sie Outreach-Ergebnisse zurück in die Daten. Die Produktansicht finden Sie auf der Seite lead generation data collection, und die Anreicherungsseite wird in contact and company enrichment behandelt.