大多数 B2B 潜在客户数据库会以两种方式之一失效,而这两种都不是抓取失败造成的。一种是逐渐腐坏,因为人员跳槽、公司变化的速度比任何人刷新记录的速度都快。另一种是变成一种负担,因为没人能说清某个联系人是从哪里来的、依据什么基础被保存,或者这个人是否要求过被移除。
这两种失效都是第一天做出的设计决策的结果。本指南介绍如何从公开来源构建一个既保持准确又经得起审查的潜在客户数据库。关于代理基础设施为何对潜在客户开发本身至关重要的论述,在面向 B2B 潜在客户开发的住宅代理一文中。这里讲的是构建过程。
从理想客户画像出发,而不是从抓取器出发
理想客户画像决定了哪些来源重要、你需要哪些字段,以及数据库应该有多大。在开始任何采集之前先把它写下来:行业、规模区间、地区、商业模式,以及能体现契合度的可观察信号。
清晰的画像能让数据库保持精简且相关。模糊的画像只会产生一个庞大的数据库,里面装满了永远不会成交的公司,而这些公司仍然带着与你真正会成交的公司同样的合规义务。
先构建账户全集
公司是稳定的那一层。在添加任何联系人之前先构建公司数据,来源应描述组织而非个人。
| 来源 | 提供的内容 | 说明 |
|---|---|---|
| 商业登记机构 | 法定名称、注册号、状态、注册地址 | 权威性强;许多提供批量文件或 API |
| 行业和协会名录 | 按行业和地区划分的会员名单 | 通常有分页且有速率限制 |
| 会议参展商和赞助商名单 | 在你所在品类中投入的公司 | 时效性强,相关度高 |
| 市场和合作伙伴名录 | 与某平台集成的公司 | 技术图谱信号强 |
| 公司网站 | 产品、地点、定价、客户 | 最丰富但也最杂的来源 |
| 招聘信息 | 增长、团队结构、使用的工具 | 一种前瞻信号;参见招聘网站数据 |
如果某个登记机构或名录提供批量数据或 API,就使用它。只对没有其他方式获取的数据进行抓取。
先解析公司身份,再做其他事
同一家公司可能以法定名称、经营名称、多个域名以及母公司和子公司的形式出现。如果不解析身份,数据库中就会充满重复项,后续的每一项统计都会被夸大。
将主要网站域名作为工作主键,因为它是各来源共享度最高的标识符。通过去除后缀和标点来规范法定名称,在有登记标识符的地方附加它们,并明确地对母子公司关系建模,而不是将它们合并。在人工核查的样本上衡量重复率,并保持可见。
企业特征信息与信号,每一项都要有来源
对于每个公司字段,存储三样东西:值、来源、观察时间。行业、规模区间、地点、技术指标和招聘活动都会变化,没有日期标注的值在六个月后是不可信的。
诸如招聘激增或新产品发布这类信号是事件,而不是属性,而且会很快贬值。关于应如何看待这一点的论述,在抓取意图信号以驱动销售情报一文中。
联系人层:先角色,后人员
联系人是腐坏和合规风险最集中的地方,所以要最后添加,而且要谨慎添加。
先对角色建模,再对人建模。 “这家公司的数据工程负责人”这个身份,在担任者离职后依然长期成立。将角色作为持久记录来存储,并将当前担任者作为带日期的观察值附加到角色上。同样的原则在构建人才图谱和组织架构数据一文中有阐述。
保持在商业语境内。 姓名、职位、公司,以及在职业语境中公开的工作邮箱或商务电话。个人邮箱地址、个人电话号码、家庭地址以及与工作无关的社交资料,不属于 B2B 数据库的范畴。
只采集公开内容,且只在被允许的范围内采集。 不要抓取登录后的内容,并遵守每个来源的条款。
不要通过探测邮件服务器来猜测地址。 生成可能的地址并对公司邮件服务器进行测试,这种做法被普遍视为滥用行为,会损害你的发信信誉,而且没有任何可辩护的价值。如果你需要经过验证的地址,请使用你已核实过的验证服务,或依赖人们自己公开发布的地址。
将合规设计进数据结构
只存在于政策文件而不存在于数据模型中的合规,经不起真实数据库的考验。把它落实到表结构里。
| 字段 | 用途 |
|---|---|
| 来源 URL 和来源类型 | 证明每个值的来源 |
| 采集时间 | 支持新鲜度和保留决策 |
| 合法依据引用 | 将记录与持有它的书面依据相关联 |
| 用途 | 将使用限制在依据所涵盖的范围内 |
| 司法辖区(如已知) | 决定外联适用哪些规则 |
| 通知状态 | 记录是否以及何时通知了当事人 |
| 保留到期时间 | 强制进行审查或删除 |
| 屏蔽标记 | 停止一切进一步的处理和外联 |
有几点法律要点塑造了这些字段。它们是通用性的,你应咨询自己的法律顾问。
- 商务联系方式属于个人数据。 根据 GDPR,一个具名人员的工作邮箱仍然是个人数据,受该法规约束。
- 合法利益必须有书面记录。 这是 B2B 拓展通常依据的基础,它需要一份书面的权衡评估,而不是一种假设。
- 必须告知当事人。 当你从当事人以外的来源获取其数据时,GDPR 通常要求告知对方,最迟应在首次联系并用于沟通时告知。
- 加州不再豁免 B2B 数据。 自 2023 年起,商务联系信息已被纳入加州隐私法的适用范围。
- 外联规则因地而异。 向商务地址发送未经请求的邮件的规则因国家而异,有些国家即使对 B2B 也要求事先获得同意。美国的商业邮件规则要求提供可用的退订方式。
屏蔽名单是永久且全局的。 当有人选择退出或要求删除时,应将其从每一张衍生表、缓存和导出文件中移除,并保留一条最小化记录,以防止其被重新采集。如果下一次抓取又把屏蔽撤销了,那就不是真正的屏蔽。
更宏观的框架在住宅代理与 GDPR 合规一文中。
大规模采集
不同来源的更新速度不同,因此应为每个来源设定各自的节奏,而不是用一个全局爬取计划。
| 来源 | 典型节奏 |
|---|---|
| 登记机构 | 每月一次,或按其自身的发布计划 |
| 名录和协会名单 | 每周到每月一次 |
| 公司网站 | 每月一次,配合变更检测 |
| 招聘信息 | 每日一次 |
| 活动名单 | 发布时采集,之后冻结 |
名录通常带有分页和限速。在一次完整的翻页过程中保持同一个出口以维持分页一致性,而在独立的页面抓取之间进行轮换。使用 Shifter 网关时,这两点都在针对 p.shifter.io:443 的凭据中设置:
customer-USERNAME-country-de-sid-dir-assoc-07-ttl-600:PASSWORD
区域性名录和登记机构通常会因地区不同而提供不同的服务内容,因此应从对应地区采集各自的数据。保持请求速率处于正常水平,遇到错误时进行退避,做法参见速率限制与请求节流。对于使用 JavaScript 加载结果的名录,发起一次渲染请求通常比自己运行浏览器更简单;参见何时需要网页抓取 API。
新鲜度是一个持续过程
潜在客户数据库会持续腐坏。应将刷新机制内建到日常运营中,而不是安排一年一度的清理。
- 按计划重新验证联系人,将任何超过阈值的”人员-角色”关联标记为过期。
- 按各自节奏重新爬取公司来源,并记录发生的变化。
- 将外联结果反馈回数据库。 退信、退订以及”此人已不在此处”的回复,是你能获得的最准确的新鲜度信号,它们必须更新到数据库中,而不只是更新外联工具。
衡量数据库
| 指标 | 说明的内容 |
|---|---|
| 理想客户画像的覆盖率 | 数据库是否包含了你所服务的市场 |
| 重复率 | 身份解析是否有效 |
| 字段完整度 | 哪些来源信息薄弱 |
| 过期分布 | 有多少数据已超过刷新阈值 |
| 退信和退订率 | 实际的准确性和同意状态健康度 |
| 采集过程中命中屏蔽名单的次数 | 是否有被屏蔽的人再次被采集 |
常见问题
抓取 B2B 联系人数据合法吗?
在数据公开、仅限商务语境、依据有书面记录的合法依据保存,并以透明和可退出的方式处理的情况下,是可以合法的。答案取决于司法辖区和用途,因此应咨询法律顾问。
我们可以抓取职业社交平台吗?
不能抓取登录后的内容,也不能违反其条款。应改为从公司网站、登记机构和名录构建数据。
我们应该购买数据而不是自建吗?
授权数据可以很好地补充自建数据。使用数据的合规义务仍然由你自己承担。
联系人应该多久重新验证一次?
频率应足以让过期比例保持较小。许多团队每季度重新核查一次活跃的目标账户,并让外联反馈来标记其余部分。
结论
一个经久耐用的 B2B 潜在客户数据库,首先是一个账户模型,其次才是一个联系人列表。从权威来源构建公司数据、解析其身份、为每个值存储来源和日期、在角色层面附加仅含商务语境数据的联系人,并将合法依据、通知、保留和屏蔽落实到数据结构中,而不是停留在政策文件里。
按各自节奏采集每个来源,让刷新持续运行,并将外联结果反馈回数据中。产品视角参见潜在客户开发数据采集页面,数据补全方面的内容参见联系人与公司数据补全。