任何做过客户 SEO 的人都熟悉这样的对话。你的排名跟踪工具报告某个目标关键词排在第三位。客户打开浏览器搜索,看到的是第七位。有人猜测工具坏了,又有人猜测客户看到的是个性化结果,会议就这样没有答案地结束了。
两个数字都可能是真实的。搜索结果不是一份固定不变的单一列表,一个排名只有在你明确了搜索发生的地点、针对谁、使用什么设备之后才有意义。但当一个跟踪工具是持续性出错而不是偶尔有差异时,原因通常不在于这些用户侧变量。而在于检查请求所经过的网络,具体说,就是搜索引擎面对的请求看起来像是家中的普通人,还是像数据中心里的服务器。
你检查排名时,搜索引擎看到了什么
一次排名检查就是从某个 IP 地址发出的一次搜索请求。搜索引擎对该请求做出的所有判断,包括提供哪个区域索引、纳入哪些本地结果、以及是否给出真实答案,都由这个地址所决定。
数据中心地址很容易被识别出来。它们属于托管服务商,处于公开注册的地址段中,搜索引擎完全有理由把来自这些地址的、看起来像自动化的流量,与来自消费者宽带的流量区别对待。这一区别在住宅代理与数据中心代理的对比一文中有所介绍,而对于排名跟踪来说,它会导致四种具体的失败模式。
你得到的是验证挑战,而不是答案。 最明显的结果是:得到的是验证码或中间页,而不是结果页。可见的失败其实是较好的情况,因为你知道出了问题。
你得到的是被降级或泛化的结果页。 这种情况更不易察觉,危害也更大。搜索引擎不是拒绝服务,而是可能提供一个比真实用户所看到的更简略或更少个性化的页面。你的解析器读取它,提取排名,存储下来的数字彼此内部一致,但却是错的,这正是检测被屏蔽或伪造内容这个问题在 SERP 上的具体体现。
你得到的是错误的地点。 这一点最能解释”排名三 vs 排名七”的争论。搜索结果被高度本地化,而搜索引擎主要依据 IP 来推断地点。数据中心地址会被定位到该数据中心所在地,所以来自某个云区域的”美国”检查,实际上是从弗吉尼亚州或俄勒冈州某个特定机房发出的搜索,而不是从你客户的顾客所居住的城市发出的搜索。对于任何带有本地意图的查询,结果集确实会有差异,而你的跟踪工具只是忠实地报告了一个真实顾客根本不会看到的排名。
你受到限流,覆盖率因此受损。 速率限制对集中来源的打击最重。检查会失败,随后被重试,你的每日数据序列最终会出现空缺和不一致的采集时间,这会悄悄破坏趋势分析。
还有第五个原因,与数据中心完全无关:地址信誉。一个被共享、过度使用或曾被滥用过的地址,无论其类型如何,都会引发验证挑战和被更改的结果,所以一批廉价的、被用滥了的地址即便名义上是住宅地址,也会产生糟糕的数据。这就是为什么IP 信誉与地址类型同样重要,也是为什么值得去核实一个代理池是否名副其实,正如识别被冒充成住宅代理的数据中心 IP一文中所述。
住宅代理能解决什么问题
住宅代理让查询通过真实的家庭网络连接发出,这直接解决了网络层面的问题成因。
查询到达时看起来就像一个普通人在家搜索,因此会得到回应而不是被挑战或降级,你得到的是真实用户会得到的页面。由于该地址属于某个真实地点的消费级 ISP,搜索引擎所应用的本地化,正是该地点居民所会经历的本地化,而在关键词带有本地意图的情况下,你还可以用城市级定位进一步细化,而不是被动接受服务器恰好所在的那个城市。由于流量分散在众多地址上,单地址速率限制就不再是制约因素,每日覆盖率得以保持,数据序列不会出现空缺。而有了国家和城市这两个参数,在多个市场跟踪同一个关键词就变成了一个配置细节,而不再是一个基础设施项目,这正是用于 SEO 监测的轮换住宅代理和本地化 Google 搜索结果中所述的模式。
它们不能解决什么问题
有必要说清楚这一点,因为住宅代理并不是解决排名准确性问题的完整答案。
它们无法解决个性化问题。如果你的检查在登录状态下运行,或携带带有历史记录的 cookie,你测量的就是个性化结果,解决办法是使用干净的、登出状态的会话,而不是换一个 IP。它们无法解决设备不匹配问题:移动端和桌面端是不同的结果页面,所以如果你跟踪的是桌面端,而客户在手机上检查,你们永远都会有分歧。它们无法解决时间不一致的问题,因为结果会在一天之内变化,把上午采集的数据和晚上采集的数据做对比,会制造出实际上并未发生的变化。它们也不能让单次读数变得有意义,因为结果本身会有波动,趋势才是信号,而不是某一个数据点。
这些是方法层面的问题,而不是网络层面的问题,需要控制的全部变量列在准确测量关键词排名一文中。住宅代理解决的是仅靠方法无法解决的那一层;方法的一致性解决剩下的问题。
如何判断你的跟踪工具是否在骗你
三项检查,难度逐步递增。
与一次正确执行的人工检查做对比。 不只是打开浏览器:使用隐私窗口,登出状态,把地点设为跟踪工具所声称测量的市场,使用同一设备类别。多数报告的差异在这一步就会消失,因为最初的对比其实是”美国桌面端、登出状态”的检查和”客户在家用手机、账号已登录”之间的对比。
验证你的跟踪工具实际捕获到了什么。 问一下它是否存储了原始结果页面。如果存储了,查看其中一个:它是否包含预期数量的自然结果、你所预期的本地结果块,以及真实用户会看到的功能特性?一个简略或泛化的页面,就是搜索引擎提供了非真实 SERP 的证据。如果你的工具只存储一个排名数字,它就无法回答这个问题,你也无法对其进行审核。
检查出口地点,而不仅仅是请求的地点。 确认你的检查所经过的地址确实被定位到你所请求的市场,更重要的是,确认目标网站的表现如同你确实身处那里:本地结果、相关情况下的本地货币、本地语言。一个请求芝加哥、却从弗吉尼亚出口的跟踪工具,会产生稳定、可重复,但错误的数据。
然后持续观察。每个市场的成功率和覆盖率应该放在仪表盘上,因为某个地区悄然的下滑,在演变成别的问题之前,首先就是一个被扭曲的趋势,这正是监控网页抓取管道中所讲的原则,也是检测 SERP 波动一文中分析的前提条件。
自建还是购买
有两条路径可以获得准确的排名数据,而这两条路径都基于同一个要求。
自行运行采集,使用住宅代理,这让你对各种变量拥有完全的控制权:测量哪些市场、使用什么设备画像、按什么时间表、存储什么内容、如何解析排名。你拥有原始的 SERP 数据,如果之后想做竞争对手分析或波动性研究,这一点很重要,而你也要负责处理解析、节奏控制,以及在结果页面布局变化时进行维护。
使用托管 API,跳过抓取这一层。你发送一个关键词和一个地点,拿回解析好的结果,采集基础设施和布局变化都由对方处理。这正是用于精确排名跟踪的 SERP API 的作用:同样的地理精准采集,以结构化结果的形式呈现,而不是需要你自己解析的页面。它用一部分控制权,换来了大幅减少的运维成本,对于要在多个市场跟踪众多客户的代理机构来说,这通常是划算的取舍。
无论走哪条路,原则都是一样的:从你所要测量的市场发出查询,保持登出状态,固定设备,按一致的时间表采样,遵守搜索引擎的条款并礼貌地控制节奏,并在把结果变成报告中的数字之前,先验证返回的确实是真实的结果页面。
结论
当排名跟踪工具与实际情况不一致时,第一个该怀疑的不是解析器,也不是客户的浏览器。而是检查请求所经过的网络。数据中心地址会遭遇验证挑战、被降级、被限流,还会被定位到错误的地点,而定位错误的情况是其中最糟糕的,因为它会产生自信满满、可重复、却描述着一次没有人真正做过的搜索的数字。一个住宅地址会让查询看起来像是一个普通人在真实地点进行搜索,而这是了解该地点搜索者实际看到什么的唯一方式。将其与干净的方法结合起来,也就是登出状态、固定设备、一致的时间安排,以及对捕获页面的验证,数字就会开始与现实相符。
这一层采集能力正是住宅代理所提供的,真实的家庭级地址,支持国家和城市定位,让每个市场都能从内部进行测量,并配有适合覆盖众多关键词和市场的小批量、高频率检查工作负载的按 GB 计费方案。