Scraping

Aufbau einer B2B-Lead-Datenbank durch Web Scraping (konform und skalierbar)

Eine Lead-Datenbank ist ein Account-Modell mit zugehörigen Kontakten, keine Liste von E-Mails. So baut man eine aus öffentlichen Quellen auf, mit Compliance direkt im Schema verankert.

Chris Collins

Chris Collins

17. September 2026 · 9 Min. Lesezeit

Die meisten B2B-Lead-Datenbanken scheitern auf eine von zwei Arten, und keine davon ist ein Scraping-Fehler. Sie verfallen, weil Menschen den Job wechseln und Unternehmen sich schneller verändern, als jemand die Datensätze aktualisiert. Oder sie werden zu einem Risiko, weil niemand sagen kann, woher ein Kontakt stammt, auf welcher Grundlage er gespeichert wird, oder ob diese Person um Entfernung gebeten hat.

Beide Fehler sind Design-Entscheidungen, die am ersten Tag getroffen werden. Dieser Leitfaden beschreibt den Aufbau einer Lead-Datenbank aus öffentlichen Quellen, sodass sie genau und verteidigungsfähig bleibt. Die Begründung, warum Proxy-Infrastruktur für die Leadgenerierung überhaupt wichtig ist, steht in residential proxies for B2B lead generation. Dies ist der Aufbau.

Beginnen Sie mit dem idealen Kundenprofil, nicht mit dem Scraper

Das ideale Kundenprofil entscheidet, welche Quellen wichtig sind, welche Felder Sie benötigen und wie groß die Datenbank sein sollte. Schreiben Sie es auf, bevor irgendeine Sammlung beginnt: Branchen, Größenklassen, Regionen, Geschäftsmodelle und die beobachtbaren Signale, die auf eine Passung hindeuten.

Ein klares Profil hält die Datenbank klein und relevant. Ein vages Profil erzeugt eine große Datenbank von Unternehmen, an die niemand jemals verkaufen wird, die aber alle dieselben Compliance-Pflichten mit sich bringen wie die, an die Sie tatsächlich verkaufen.

Bauen Sie zuerst das Unternehmensuniversum auf

Unternehmen sind die stabile Schicht. Bauen Sie sie vor allen Kontakten auf, aus Quellen, die Organisationen beschreiben, nicht Menschen.

QuelleWas sie liefertAnmerkungen
HandelsregisterRechtlicher Name, Registrierungsnummer, Status, eingetragene AdresseMaßgeblich; viele bieten Massendaten oder APIs an
Branchen- und VerbandsverzeichnisseMitgliederlisten nach Sektor und RegionOft paginiert und ratenbegrenzt
Aussteller- und Sponsorenlisten von KonferenzenUnternehmen, die in Ihre Kategorie investierenZeitlich begrenzt und hochrelevant
Marktplatz- und PartnerverzeichnisseUnternehmen, die mit einer bestimmten Plattform integrierenStarkes technografisches Signal
UnternehmenswebsitesProdukte, Standorte, Preise, KundenDie reichhaltigste Quelle, und die vielfältigste
StellenausschreibungenWachstum, Teamstruktur, verwendete ToolsEin Frühindikator; siehe job-board data

Wo ein Register oder Verzeichnis Massendaten oder eine API veröffentlicht, nutzen Sie diese. Scrapen Sie nur, was auf keine andere Weise angeboten wird.

Klären Sie die Unternehmensidentität, bevor irgendetwas anderes passiert

Dasselbe Unternehmen erscheint unter einem rechtlichen Namen, einem Handelsnamen, mehreren Domains und als Mutter- und Tochtergesellschaften. Wird die Identität nicht geklärt, füllt sich die Datenbank mit Duplikaten, und jede nachgelagerte Zählung wird verzerrt.

Verwenden Sie die primäre Web-Domain als Arbeitsschlüssel, da sie der Identifikator ist, den die meisten Quellen gemeinsam haben. Normalisieren Sie rechtliche Namen, indem Sie Suffixe und Interpunktion entfernen, verknüpfen Sie Registrierungskennungen, wo Sie diese haben, und modellieren Sie Mutter- und Tochterbeziehungen explizit, anstatt sie zusammenzuführen. Messen Sie die Duplikatsrate an einer manuell geprüften Stichprobe und behalten Sie diese im Blick.

Firmografische Daten und Signale, jedes mit einer Quelle

Speichern Sie für jedes Unternehmensfeld drei Dinge: den Wert, woher er stammt, und wann er beobachtet wurde. Branche, Größenklasse, Standorte, technologische Indikatoren und Einstellungsaktivität ändern sich alle, und ein Wert ohne Datum kann sechs Monate später nicht mehr vertraut werden.

Signale wie Einstellungsspitzen oder neue Produkteinführungen sind Ereignisse und keine Attribute, und sie verlieren schnell an Wert. Die Begründung dafür, sie so zu behandeln, steht in scraping intent signals to power sales intelligence.

Die Kontaktebene: zuerst Rollen, dann Menschen

Kontakte sind der Punkt, an dem sich sowohl Verfall als auch Compliance-Risiko konzentrieren, also fügen Sie sie zuletzt und mit Sorgfalt hinzu.

Modellieren Sie Rollen vor Menschen. „Head of Data Engineering bei diesem Unternehmen” bleibt lange wahr, nachdem die Person, die diese Rolle innehat, weitergezogen ist. Speichern Sie die Rolle als den dauerhaften Datensatz und verknüpfen Sie die aktuelle Person als Beobachtung mit einem Datum. Dasselbe Prinzip wird in building talent-mapping and org-chart data dargelegt.

Bleiben Sie im geschäftlichen Kontext. Name, Rolle, Unternehmen und eine geschäftliche E-Mail-Adresse oder Telefonnummer, die in einem beruflichen Kontext veröffentlicht wurden. Private E-Mail-Adressen, private Telefonnummern, Privatadressen und Social-Media-Profile ohne Bezug zur Arbeit gehören nicht in eine B2B-Datenbank.

Sammeln Sie nur, was öffentlich ist, und nur dort, wo es Ihnen erlaubt ist. Scrapen Sie keine Inhalte hinter einem Login und respektieren Sie die Nutzungsbedingungen jeder Quelle.

Testen Sie keine Mailserver, um Adressen zu erraten. Das Generieren wahrscheinlicher Adressen und deren Testen gegen den Mailserver eines Unternehmens gilt weithin als missbräuchlich, schädigt Ihren Versandruf und bringt nichts, was Sie verteidigen könnten. Wenn Sie verifizierte Adressen benötigen, nutzen Sie einen geprüften Verifizierungsdienst oder verlassen Sie sich auf Adressen, die Personen selbst veröffentlicht haben.

Compliance ins Schema einbauen

Compliance, die nur in einem Richtliniendokument existiert und nicht im Datenmodell, übersteht den Kontakt mit einer echten Datenbank nicht. Bringen Sie sie in die Tabellen.

FeldZweck
Quell-URL und QuellentypBelegt, woher jeder Wert stammt
Erfasst amUnterstützt Entscheidungen zu Aktualität und Aufbewahrung
Verweis auf die RechtsgrundlageVerknüpft den Datensatz mit der dokumentierten Grundlage für dessen Speicherung
ZweckBeschränkt die Nutzung auf das, was die Grundlage abdeckt
Jurisdiktion, sofern bekanntBestimmt, welche Regeln für Outreach gelten
HinweisstatusVermerkt, ob und wann die Person informiert wurde
Ablauf der AufbewahrungErzwingt Überprüfung oder Löschung
SperrvermerkStoppt jede weitere Verarbeitung und jeden Outreach

Einige rechtliche Punkte prägen diese Felder. Sie sind allgemein gehalten, und Sie sollten sich mit Ihrer eigenen Rechtsberatung abstimmen.

  • Geschäftliche Kontaktdaten sind personenbezogene Daten. Unter der DSGVO ist die geschäftliche E-Mail-Adresse einer namentlich genannten Person weiterhin personenbezogen, und die Verordnung gilt.
  • Berechtigtes Interesse muss dokumentiert werden. Es ist die übliche Grundlage für B2B-Prospecting, und es erfordert eine schriftliche Abwägungsprüfung, keine Annahme.
  • Personen müssen informiert werden. Wenn Sie die Daten einer Person aus anderen Quellen als von ihr selbst erhalten, verlangt die DSGVO im Allgemeinen, sie zu informieren, spätestens beim ersten Kontakt, wenn Sie die Daten zur Kommunikation nutzen.
  • Kalifornien nimmt B2B-Daten nicht mehr aus. Seit 2023 fallen geschäftliche Kontaktinformationen unter das kalifornische Datenschutzgesetz.
  • Outreach-Regeln variieren. Regeln für unaufgeforderte E-Mails an geschäftliche Adressen unterscheiden sich je nach Land, und manche verlangen vorherige Zustimmung selbst bei B2B. US-amerikanische Regeln für kommerzielle E-Mails erfordern eine funktionierende Abmeldemöglichkeit.

Die Sperrliste ist dauerhaft und global. Wenn jemand widerspricht oder um Löschung bittet, entfernen Sie diese Person aus jeder abgeleiteten Tabelle, jedem Cache und jedem Export, und behalten Sie einen minimalen Eintrag, der die erneute Erfassung verhindert. Eine Sperre, die durch den nächsten Crawl aufgehoben wird, ist keine Sperre.

Die breitere Einordnung findet sich in residential proxies and GDPR compliance.

Sammeln im großen Maßstab

Verschiedene Quellen bewegen sich mit unterschiedlicher Geschwindigkeit, geben Sie also jeder ihren eigenen Rhythmus statt eines globalen Crawls.

QuelleTypischer Rhythmus
RegisterMonatlich, oder nach deren eigenem Veröffentlichungsplan
Verzeichnisse und VerbandslistenWöchentlich bis monatlich
UnternehmenswebsitesMonatlich, mit Änderungserkennung
StellenausschreibungenTäglich
VeranstaltungslistenBei Veröffentlichung, dann eingefroren

Verzeichnisse sind meist paginiert und gedrosselt. Halten Sie einen Exit über einen kompletten Durchlauf konstant, damit die Paginierung stimmig bleibt, und rotieren Sie für unabhängige Seitenabrufe. Mit dem Shifter-Gateway werden beide in den Zugangsdaten gegen p.shifter.io:443 festgelegt:

customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD

Regionale Verzeichnisse und Register liefern oft je nach Standort unterschiedliche Ergebnisse, sammeln Sie also jede Region aus dieser Region. Halten Sie die Anfragerate normal und drosseln Sie bei Fehlern, wie in rate limiting and request throttling beschrieben. Für Verzeichnisse, die Ergebnisse per JavaScript laden, ist eine gerenderte Anfrage oft einfacher als eigene Browser zu betreiben; siehe when you need a web scraping API.

Aktualität ist ein Prozess

Eine Lead-Datenbank verfällt kontinuierlich. Bauen Sie die Aktualisierung in den Betrieb ein, statt eine jährliche Bereinigung anzusetzen.

  • Verifizieren Sie Kontakte nach einem Zeitplan neu und markieren Sie jede Person-zu-Rolle-Verknüpfung, die älter als Ihr Schwellenwert ist, als veraltet.
  • Crawlen Sie Unternehmensquellen erneut in ihrem Rhythmus und protokollieren Sie, was sich geändert hat.
  • Speisen Sie Outreach-Ergebnisse zurück. Bounces, Abmeldungen und Antworten wie „nicht mehr hier” sind das genaueste Aktualitätssignal, das Sie erhalten werden, und sie müssen die Datenbank aktualisieren, nicht nur das Outreach-Tool.

Die Datenbank messen

MetrikWas sie Ihnen sagt
Abdeckung des idealen KundenprofilsOb die Datenbank den Markt enthält, an den Sie verkaufen
DuplikatsrateOb die Identitätsauflösung funktioniert
FeldvollständigkeitWo Quellen dünn sind
Verteilung der VeraltungWie viel der Daten den Aktualisierungsschwellenwert überschritten hat
Bounce- und AbmelderatenReale Genauigkeit und Zustimmungszustand
Sperrlisten-Treffer während der SammlungOb gesperrte Personen erneut erfasst werden

FAQ

Ist das Scrapen von B2B-Kontaktdaten legal?

Es kann sein, wenn die Daten öffentlich sind, nur geschäftlichen Kontext betreffen, auf einer dokumentierten Rechtsgrundlage gespeichert werden und mit Transparenz und Widerspruchsmöglichkeiten gehandhabt werden. Die Antwort hängt von Jurisdiktion und Verwendungszweck ab, ziehen Sie also Rechtsberatung hinzu.

Können wir professionelle Netzwerkplattformen scrapen?

Nicht hinter einem Login, und nicht gegen deren Nutzungsbedingungen. Bauen Sie stattdessen auf Unternehmenswebsites, Registern und Verzeichnissen auf.

Sollten wir Daten kaufen, statt sie selbst aufzubauen?

Lizenzierte Daten ergänzen einen eigenen Aufbau gut. Die Compliance-Pflichten für deren Nutzung liegen weiterhin bei Ihnen.

Wie oft sollten Kontakte neu verifiziert werden?

Oft genug, dass der veraltete Anteil klein bleibt. Viele Teams überprüfen aktive Zielunternehmen vierteljährlich erneut und lassen Outreach-Feedback den Rest kennzeichnen.

Fazit

Eine dauerhafte B2B-Lead-Datenbank ist zuerst ein Unternehmensmodell und erst danach eine Kontaktliste. Bauen Sie Unternehmen aus maßgeblichen Quellen auf, klären Sie deren Identität, speichern Sie jeden Wert mit seiner Quelle und seinem Datum, verknüpfen Sie Kontakte auf Rollenebene mit ausschließlich geschäftlichem Kontext, und bringen Sie Rechtsgrundlage, Hinweis, Aufbewahrung und Sperrung ins Schema statt in eine Richtlinie.

Sammeln Sie jede Quelle in ihrem eigenen Rhythmus, halten Sie die Aktualisierung kontinuierlich am Laufen, und speisen Sie Outreach-Ergebnisse zurück in die Daten. Die Produktansicht finden Sie auf der Seite lead generation data collection, und die Anreicherungsseite wird in contact and company enrichment behandelt.

Bereit, loszulegen?

Testen Sie Shifters Residential-Proxys, 205M+ IPs, 195+ Länder, ab 0,75 $/GB.

Jetzt starten