数据增强是指为你已经持有的记录添加信息的过程。一个潜在客户到来时只带有姓名和工作邮箱;增强会补充公司的行业、规模、地理位置和技术栈,也许还有此人的职位和资历级别。CRM 中存在一个只有名称的账户;增强会补充其域名、员工人数区间和近期招聘情况。
这与列表构建不同,后者是从零开始创建记录。这部分内容在通过网页抓取构建 B2B 潜在客户数据库中有介绍。增强则是从你已有的数据出发,使其变得更有用,而结果的质量在很大程度上取决于匹配和数据来源的决策,而非依赖任何单一的数据提供商。
四种增强类型
| 类型 | 示例字段 | 典型来源 |
|---|---|---|
| 企业信息(Firmographic) | 行业、规模区间、营收区间、地点、所有权 | 注册机构、公司网站、授权数据提供商 |
| 技术画像(Technographic) | 公司使用的工具和平台 | 网站源代码和响应头、公开 DNS 记录、招聘信息 |
| 联系人信息(Contact) | 职位、资历、部门、商务联系方式 | 公司网站、专业名录、授权数据提供商 |
| 意向与活动(Intent and activity) | 招聘、发布、融资、调研行为 | 招聘信息、新闻、评测和比较网站 |
大多数团队首先需要企业信息,因为它驱动路由和评分。联系人增强承载着最重的合规责任。意向信号的价值消退最快,相关内容见抓取意向信号以支持销售情报。
连接键决定一切
增强首先是一个匹配问题,其次才是数据问题。每一个附加的值,其质量都取决于你的记录与来源记录之间的关联链接。
公司域名是最佳的键。 它被大多数来源共享,且很少产生歧义。仅凭公司名称进行增强,会在名称相似的公司之间产生看似可信实则错误的匹配。
邮箱域名将个人映射到公司,但有一个重大例外:免费邮箱域名无法映射到任何公司。仅凭个人邮箱地址的潜在客户,无法仅从该地址在公司层面得到增强。
注册机构标识符在你拥有它们的情况下具有权威性,尤其对于法律实体和子公司而言。
为每个增强字段存储一个匹配置信度,并拒绝将低置信度的匹配写入驱动路由或定价的字段。账户上错误的行业信息比空白更糟。
增强数据的来源
| 来源 | 优势 | 劣势 |
|---|---|---|
| 第一方数据 | 准确、已获同意、专属于你 | 只覆盖告知过你的人群 |
| 公开网络 | 时效性强、覆盖面广、单条记录成本低 | 需要采集基础设施和解析工作 |
| 商业注册机构 | 对法律事实具有权威性 | 范围狭窄;没有商业信号 |
| 授权数据提供商 | 集成速度快、覆盖面广 | 成本高、来源不透明、新鲜度参差不齐 |
最强的方案是将这四者结合起来。第一方数据在其存在的地方胜出,注册机构确定法律事实,授权数据提供商快速填补广度,公开网络采集提供新鲜度以及任何提供商都不出售的特定信号。
供应商的数据来源既是它们的风险,也是你的风险。如果一个提供商无法解释其联系人数据来自何处以及基于何种依据,那么在你使用这些数据时,这种不确定性就转移到了你身上。
瀑布式增强
与其信任每个字段只来自一个来源,不如按既定顺序运行多个来源,一旦某字段以足够的置信度被填充,就停止。
- 检查第一方数据。
- 查询权威来源,例如注册机构负责的字段。
- 从公司自身的公开信息中采集,这通常是关于自身最新的描述。
- 对于剩余的缺口,回退到授权数据提供商。
记录是哪个来源填充了每个字段。然后按字段而非按来源来定义优先级:注册机构在法定名称上胜出,公司网站通常在产品描述上胜出,招聘信息在当前招聘情况上胜出。当来源之间的分歧超出容差范围时,保留两者并标记冲突,而不是悄悄地选择其中一个。
代理基础设施适用之处,以及不适用之处
授权数据提供商和官方 API 不需要代理。你可以用密钥直接调用它们。关于代理基础设施在潜在客户生成和增强领域更广泛的应用,见用于 B2B 潜在客户生成的住宅代理。
公开网络来源则需要代理,原因与任何大规模采集相同。
公司网站是许多小型、独立的站点。它们很少屏蔽普通流量,但来自单一地址的大量流量会引发限流,而且有些网站会因地区不同而呈现不同内容。
注册机构和名录存在速率限制,有时具有地域性,并且许多以需要保持一致会话的方式对结果进行分页。
招聘信息按地理位置过滤,因此某地区的招聘信号必须从该地区采集;参见招聘网站数据与劳动力市场情报。
使用 Shifter 网关时,市场和会话在针对 p.shifter.io:443 的凭据中设置:
customer-USERNAME-country-fr-sid-enrich-registry-03-ttl-600:PASSWORD
保持一个出口并使用 sid 适合分页的注册机构查询。省略它则会按请求轮换,适合抓取许多独立的公司主页。这种权衡取舍详见粘性住宅代理与轮换住宅代理对比。
对于使用 JavaScript 渲染内容的网站,通过提取规则返回结构化 JSON 的网页抓取 API 可以省去解析和浏览器相关的工作,并且只对成功的响应计费。关于如何可靠地落地这些输出数据,见将网页抓取 API 数据导入 SQL。
诚实看待技术画像检测
技术指标来自公开信号:脚本标签和页面源代码、响应头、公开 DNS 记录(如邮件和域名验证条目)、合作伙伴名录以及招聘信息中提及的工具。
应将每一个信号视为带有置信水平的证据,而非事实。公司停止付费使用某工具后遗留下来的标签很常见。某条招聘信息中的提及可能指的是遗留系统。两个或更多独立信号相互印证,远比单一信号可靠得多。
新鲜度
增强数据以不同的速率衰减。公司名称和域名可以多年保持稳定;员工人数和技术栈在数月内发生变化;职位和联系方式变化最快。
按触发条件而非单一时间表重新增强:当记录被销售人员接触时、当某个信号提示发生变化时,以及按与每个字段衰减速率匹配的周期性周期。为每个字段存储观测日期,以便过时情况可见。
联系人增强的合规性
增强某个人的记录属于处理其个人数据,而义务不会因为数据来源是公开的而减轻。作为一般性指导,并请咨询你自己的法律顾问:
- 限定目的和字段。 仅附加文档记录的目的所需的信息。个人电话号码、个人社交资料和家庭住址不属于 B2B 增强的范畴。
- 保持透明。 当个人数据是从本人以外的来源获得时,GDPR 通常要求在首次联系时(最迟)告知本人。
- 传播退出请求和删除请求。 一项抑制(suppression)必须传达到增强缓存以及所有接收过增强数据的系统,否则下一次增强运行会悄悄地恢复已被移除的内容。
- 了解你的供应商。 对提供商数据来源的尽职调查是你自身问责的一部分。
更广泛的框架见住宅代理与 GDPR 合规性。
衡量增强效果
| 指标 | 它能告诉你什么 |
|---|---|
| 匹配率 | 以足够置信度关联到来源记录的记录比例 |
| 每字段填充率 | 覆盖率薄弱的地方 |
| 抽查样本的准确率 | 已填充的值是否正确 |
| 冲突率 | 来源之间产生分歧的频率 |
| 每字段新鲜度 | 有多少数据已超过其重新增强的阈值 |
| 每条增强记录的成本 | 真实的经济效益,包括失败和低置信度的查询 |
准确率是团队常常跳过的指标,而它恰恰是最重要的。每季度手动抽查一个随机样本。
常见问题
什么是数据增强?
将来自其他来源的属性附加到你已有的记录上,例如为账户添加行业、规模和技术信息,或为联系人添加职位和资历。
数据增强需要代理吗?
仅在公开网络采集时需要。授权数据提供商和官方 API 是直接调用的。
哪种增强应该优先进行?
企业信息,因为它驱动路由、评分和细分。联系人增强随后进行,且需要最谨慎的处理。
为什么我们的增强数据会反复变来变去?
通常是两个来源的值不同,且没有优先级规则。请为每个字段定义优先级并标记冲突,而不是让最后一次写入的数据获胜。
总结
增强的质量来自围绕数据做出的决策,而非来自任何单一来源:可靠的连接键、每个字段的匹配置信度、优先考虑第一方和权威来源的瀑布流程、按字段划分的优先级规则,以及按属性跟踪的新鲜度。
在增强涉及公开网络的地方使用代理基础设施,直接调用授权来源,并将联系人增强限定在有文档记录的目的范围内,确保退出请求能传达到每一份副本。产品介绍见用于潜在客户生成的住宅代理页面,价格见定价页面。