B2Bのリードデータベースの大半は、二つの理由のいずれかで失敗する。どちらもスクレイピングの失敗ではない。一つは劣化だ。人は転職し、企業は形を変えるが、そのスピードにレコードの更新が追いつかない。もう一つは負債化だ。ある連絡先がどこから来たのか、どのような根拠で保持されているのか、あるいはその人物が削除を求めたかどうかを、誰も答えられなくなる。
どちらの失敗も、初日に下された設計上の判断の結果である。本ガイドでは、公開情報源からリードデータベースを構築し、それを正確かつ弁明可能な状態に保つ方法を扱う。そもそもプロキシインフラがリードジェネレーションにとってなぜ重要なのかについては、residential proxies for B2B lead generation で論じている。本記事は、その構築編である。
スクレイパーではなく、理想の顧客プロファイルから始める
理想の顧客プロファイルは、どの情報源が重要か、どのフィールドが必要か、データベースがどの程度の規模であるべきかを決定する。収集を始める前にこれを書き出しておくこと。業界、規模帯、地域、ビジネスモデル、そして適合を示す観察可能なシグナルである。
明確なプロファイルは、データベースを小さく関連性の高いものに保つ。曖昧なプロファイルは、誰にも売り込むことのない企業からなる巨大なデータベースを生み出すが、それでも実際に売り込む企業と同じコンプライアンス義務を負うことになる。
まずアカウント全体を構築する
企業は安定した層である。人物ではなく組織を記述する情報源から、コンタクトより先に企業を構築する。
| 情報源 | 得られるもの | 備考 |
|---|---|---|
| 商業登記簿 | 正式名称、登録番号、ステータス、登記住所 | 権威性が高い。多くは一括ファイルやAPIを提供 |
| 業界団体・協会のディレクトリ | セクターと地域別の会員リスト | ページ分割やレート制限がかかることが多い |
| カンファレンスの出展者・スポンサーリスト | 自社カテゴリに投資している企業 | 期間限定で関連性が非常に高い |
| マーケットプレイスやパートナーディレクトリ | 特定のプラットフォームと連携している企業 | テクノグラフィックシグナルとして強力 |
| 企業のウェブサイト | 製品、拠点、価格、顧客 | 最も情報が豊富で、最もばらつきがある情報源 |
| 求人情報 | 成長、チーム構成、使用ツール | 先行シグナル。job-board data を参照 |
登記簿やディレクトリが一括データやAPIを公開している場合は、それを使う。他に手段がないものだけをスクレイピングする。
何よりも先に企業アイデンティティを解決する
同じ企業が、正式名称、取引名、複数のドメイン、親会社と子会社といった形で現れる。アイデンティティが解決されていなければ、データベースは重複で埋め尽くされ、以降のすべての集計は水増しされる。
主要なウェブドメインを作業キーとして使う。これは多くの情報源が共有している識別子だからである。接尾辞や句読点を取り除いて正式名称を正規化し、可能であれば登記識別子を紐づけ、親会社と子会社の関係は統合せず明示的にモデル化する。手作業で確認したサンプルで重複率を測定し、それを常に見える状態にしておく。
ファームグラフィックとシグナル、それぞれに情報源を
企業に関するすべてのフィールドについて、値、その出所、観測日時の三つを保存する。業界、規模帯、拠点、技術指標、採用活動はいずれも変化するものであり、日付のない値は半年後には信頼できない。
採用の急増や新製品発表といったシグナルは、属性ではなくイベントであり、価値の減衰が早い。それらをそのように扱うべき理由については、scraping intent signals to power sales intelligence で論じている。
コンタクト層:人より先に役職を
コンタクトは劣化とコンプライアンスリスクの両方が集中する場所であり、だからこそ最後に、かつ慎重に追加する。
人より先に役職をモデル化する。 「この会社のデータエンジニアリング責任者」という事実は、その役職に就く人物が異動した後も長く真であり続ける。役職を永続的なレコードとして保存し、現在その役職にある人物を日付付きの観測として紐づける。同じ原則が building talent-mapping and org-chart data にも示されている。
ビジネス文脈に留める。 氏名、役職、企業名、そして職業的な文脈で公開されている業務用メールアドレスや業務用電話番号。個人のメールアドレス、個人の電話番号、自宅住所、仕事と無関係なソーシャルプロフィールは、B2Bデータベースにはふさわしくない。
公開されているものだけを、許可されている範囲でのみ収集する。 ログインの背後にあるコンテンツはスクレイピングしないこと。各情報源の利用規約を尊重すること。
メールサーバーを探査してアドレスを推測してはならない。 ありそうなアドレスを生成し、企業のメールサーバーに対してテストする行為は、広く悪質とみなされており、送信元の評判を損ない、弁明できるものを何も生み出さない。検証済みのアドレスが必要な場合は、審査済みの検証サービスを利用するか、本人が自ら公開したアドレスに依拠すること。
コンプライアンスをスキーマに組み込む
ポリシー文書の中にだけ存在し、データモデルには存在しないコンプライアンスは、実際のデータベースに触れた瞬間に崩れる。それをテーブルの中に置くこと。
| フィールド | 目的 |
|---|---|
| ソースURLとソース種別 | 各値の出所を証明する |
| 収集日時 | 鮮度と保持の判断を支える |
| 適法根拠の参照 | そのレコードを、保持の文書化された根拠に結びつける |
| 目的 | 利用をその根拠が対象とする範囲に限定する |
| 判明している場合の管轄 | どの規則がアウトリーチに適用されるかを決める |
| 通知ステータス | 本人に知らされたか、いつ知らされたかを記録する |
| 保持期限 | 見直しまたは削除を強制する |
| 抑制フラグ | あらゆる処理とアウトリーチを停止させる |
いくつかの法的論点が、これらのフィールドの形を決めている。以下は一般論であり、必ず自身の弁護士と協議すること。
- 業務上の連絡先情報も個人データである。 GDPRの下では、氏名が特定された人物の業務用メールアドレスも個人データであり、規則が適用される。
- 正当な利益は文書化しなければならない。 これはB2Bのプロスペクティングにおける通常の根拠だが、想定ではなく、書面によるバランシング評価が必要である。
- 本人には知らせなければならない。 本人以外の情報源からデータを取得した場合、GDPRは一般に本人への通知を求めており、コミュニケーションに利用する場合は遅くとも最初の接触時までに行う必要がある。
- カリフォルニア州はもはやB2Bデータを除外していない。 2023年以降、業務上の連絡先情報はカリフォルニア州のプライバシー法の適用範囲に含まれている。
- アウトリーチの規則は地域によって異なる。 業務用アドレスへの未承諾メールに関する規則は国によって異なり、B2Bであっても事前の同意を求める国もある。米国の商業メールに関する規則は、機能するオプトアウトを義務づけている。
抑制リストは恒久的かつグローバルである。 誰かがオプトアウトした、あるいは削除を求めた場合、派生するすべてのテーブル、キャッシュ、エクスポートからその人物を削除し、再収集を防ぐための最小限の記録を保持すること。次のクロールで元に戻ってしまう抑制は、抑制とは呼べない。
より広い枠組みについては、residential proxies and GDPR compliance を参照。
大規模収集
情報源ごとに動く速度が異なるため、一つのグローバルなクロールではなく、それぞれに固有の周期を与える。
| 情報源 | 一般的な周期 |
|---|---|
| 登記簿 | 月次、またはその独自の公開スケジュールに従う |
| ディレクトリと協会リスト | 週次から月次 |
| 企業ウェブサイト | 月次、変更検知付き |
| 求人情報 | 日次 |
| イベントリスト | 公開時、その後は固定 |
ディレクトリは通常ページ分割されておりスロットリングされている。ページ送りの一貫性を保つため、一連の巡回全体を通じて一つの出口を保持し、独立したページ取得ごとにローテーションすること。Shifterのゲートウェイでは、両方とも p.shifter.io:443 に対する認証情報の中で設定する。
customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD
地域のディレクトリや登記簿は、位置によって提供内容が異なることが多いため、各地域はその地域から収集する。リクエストレートは通常どおりに保ち、エラー時にはバックオフすること。rate limiting and request throttling を参照。JavaScriptで結果を読み込むディレクトリについては、自前のブラウザを動かすよりレンダリング済みリクエストの方が簡単な場合が多い。when you need a web scraping API を参照。
鮮度は継続的なプロセスである
リードデータベースは絶えず劣化する。年次の一斉クリーンアップを予定するのではなく、更新を運用そのものに組み込むこと。
- コンタクトを定期的に再検証する。 しきい値より古い人物と役職の紐づけは、すべて陳腐化としてマークする。
- 企業の情報源を、その周期で再クロールする。 何が変わったかを記録する。
- アウトリーチの結果をフィードバックする。 バウンス、オプトアウト、「もうここにはいません」という返信は、得られる中で最も正確な鮮度シグナルであり、アウトリーチツールだけでなくデータベース自体を更新しなければならない。
データベースの測定
| 指標 | わかること |
|---|---|
| 理想の顧客プロファイルのカバー率 | データベースが自社の売り込む市場を含んでいるかどうか |
| 重複率 | アイデンティティ解決が機能しているかどうか |
| フィールドの充足度 | 情報源が薄い箇所 |
| 陳腐化の分布 | データのうちどれだけが更新しきい値を過ぎているか |
| バウンス率とオプトアウト率 | 実世界での正確性と同意の健全性 |
| 収集中の抑制ヒット | 抑制済みの人物が再収集されていないかどうか |
よくある質問
B2Bのコンタクトデータをスクレイピングすることは合法か。
データが公開されており、業務文脈に限定され、文書化された適法根拠のもとで保持され、透明性とオプトアウトをもって扱われていれば、合法でありうる。答えは管轄と用途に依存するため、弁護士を関与させること。
プロフェッショナル向けネットワーキングプラットフォームをスクレイピングできるか。
ログインの背後では不可であり、その利用規約に反する形でも不可である。代わりに企業サイト、登記簿、ディレクトリから構築すること。
構築するより、データを購入すべきか。
ライセンスされたデータは、構築をうまく補完する。ただし、その利用方法に関するコンプライアンス義務は依然として自社側にある。
コンタクトはどのくらいの頻度で再検証すべきか。
陳腐化した部分の割合が小さく保たれる程度の頻度で。多くのチームは、アクティブなターゲットアカウントを四半期ごとに再確認し、それ以外はアウトリーチのフィードバックに委ねている。
結論
長く使えるB2Bリードデータベースは、まずアカウントモデルであり、コンタクトリストはその次である。権威ある情報源から企業を構築し、そのアイデンティティを解決し、すべての値をその出所と日付とともに保存し、業務文脈のデータのみを用いて役職レベルでコンタクトを紐づけ、適法根拠、通知、保持、抑制はポリシーではなくスキーマの中に置くこと。
各情報源をそれぞれの周期で収集し、更新を継続的に稼働させ、アウトリーチの結果をデータにフィードバックすること。プロダクトとしての視点は lead generation data collection のページにあり、エンリッチメントの側面は contact and company enrichment で扱っている。