知识

为什么AI代理需要实时SERP API来访问搜索数据

模型的知识存在边界。无法看到边界之外内容的代理仍会自信地给出答案,而搜索访问功能正是为了防止这种失败模式。

Matt Brown

Matt Brown

2026年9月3日 · 1 分钟阅读

每个语言模型的知识都有边界,而有趣的问题不在于这个边界的存在,而在于模型无法感知它。问一个上周才发生变化的事情,你得到的答案会和一个已经稳定了十年的事情一样自信。对于聊天界面来说,这是一个可以容忍的小麻烦。对于代表某人采取行动的智能体来说,这正是整个架构本应防止的那种失败模式。

搜索访问是标准答案,值得精确说明它究竟解决了什么,以及没有解决什么。

搜索访问为智能体带来了什么

三件事,值得分开来看,因为它们决定了应该投入多少工程量。

时效性。 训练之后发生变化的事实:价格、可用性、谁担任某个职位、某公司宣布了什么、某项服务是否正常运行。这是最明显的一点。

广度。 无论日期如何,那些在训练数据中从未被充分呈现过的长尾细节。对于冷门信息,搜索是比任何模型参数都更好的索引。

可验证性。 智能体可以引用、用户可以核实的来源。对于任何重要的事情,这一点比时效性更重要,因为价值不仅仅在于答案正确,还在于答案可追溯,这正是让智能体的输出可供审查、而不是只能凭信任接受的原因。

第三点说明了为什么”模型可以直接回答”是不够的,即使模型是对的。会引用来源的智能体是可审计的;只是断言的智能体则不是。

为什么用 SERP API 而不是让智能体自己浏览网页

可以给智能体配一个浏览器,让它自己搜索。这是一个合理的直觉,但在生产环境中会因为结构性而非偶然的原因而严重退化。

脆弱性。 搜索结果页面的布局会变化,而解析 HTML 的智能体在布局变化时会悄无声息地失败。这种失败表现为智能体一无所获,而不是报错,这对于一个本应自主运行的系统来说,是最糟糕的 bug 形态。

延迟。 渲染页面、等待脚本执行、提取文本,这些都会在一个可能针对单次用户请求运行多次的循环中消耗数秒时间。结构化结果一次调用就能获得,这对于多步骤的智能体来说是能不能用的区别,延迟的具体机制在降低延迟中有说明。

Token 成本。 把原始 HTML 塞进上下文窗口既昂贵又大部分是噪音。解析后的标题、摘要和 URL 用更少的 token 传递更多的信号。

被封锁。 自动化浏览会遭遇验证,而遇到验证码的智能体没有好的应对办法。这与会浏览网页的 AI 智能体最佳代理中描述的访问问题是同一个问题,而 SERP API 通过把采集工作交给别人处理、直接返回结构化数据来解决它。

这是智能体构建者最终都会明白的一个通用原则:工具应该返回结构化、可预测的输出,因为一个形态在你手底下变来变去的工具,是模型无法可靠地对其进行推理的工具。

设计这个工具,而不只是调用它

智能体搜索行为的质量更多取决于工具设计,而不是底层数据源。

返回少量优质的结果。 十条带摘要的结果通常比五条包含相同信息的结果更差,因为上下文是有限的,对于推理来说精确胜过全面。如果智能体确实需要更多,可以让它明确请求。

将位置和语言作为参数暴露出来。 搜索结果因市场而异,所以为德国用户作答的智能体应该像身处德国一样进行搜索,否则它会自信地报告一个只在其他国家才成立的事实。这与贯穿这个领域其他方方面面的地理要求是同一个问题,也是智能体给出微妙错误答案的常见原因。

返回模型可以据以推理的元数据。 URL,以及在可获得的情况下的发布日期,能让模型权衡不同来源,而不是把一篇清单式文章等同于一手来源。

保持接口的稳定性。 如果结果的形态发生变化,围绕它调优的提示行为也会随之变化。

诚实地看待其局限

搜索访问不是真理神谕,假装它是会产生另一类自信的错误。

排名反映的是相关性,而不是准确性。 排名靠前的页面是受欢迎的、优化得好的、主题匹配的。这些都不能保证正确性,而把排位当作权威的智能体,会把 SEO 洗白成事实。

摘要会丢失上下文。 一段摘录可能颠倒其来源页面的原意。如果某个说法很重要,智能体应该去检索整个页面,而不是仅凭摘要进行推理,这正是像住宅代理这样的通用采集层与搜索工具配合使用的地方。

搜索结果本身就是一个快照。 它们是个性化的、本地化的,并且逐时变化,所以同一个智能体运行两次可能会得出合理但不同的结果。要把查询、结果和答案一并记录下来,否则你无法重建智能体当初为什么这么说。

实时性是有预算的。 每一次搜索都在循环中消耗延迟和成本,所以一个条件反射式搜索的智能体既慢又贵。设计上要考虑的问题是何时该搜索,一个合理的默认策略是:当答案依赖于当前事实、依赖于模型很可能含糊不清的具体细节、或者需要引用来源时才搜索,否则就不搜索。

未来的方向

值得指出的更大趋势是,网络正越来越多地被智能体而非人类阅读,这改变了基础设施需要服务的对象。这正是网络上的 AI 智能体所探讨的主题,而这是双向的:智能体需要对公开信息的可靠结构化访问,发布者也需要这种访问是规矩的,而不是不加区分的。

对构建者而言,现实的含义是,搜索访问正在成为一个标准组件,而不是一个集成项目,差异化则转向智能体在何时决定搜索、如何权衡所发现的内容、以及是否展示其推理过程上。

结论

没有搜索访问能力的智能体,在超出其知识边界的问题上,会以和边界之内同样的自信作答,这正是自主性使其变得危险的行为。搜索访问带来了时效性、广度,以及最重要的可验证性,因为会引用来源的智能体是可审计的,只做断言的智能体则不是。相比让智能体自己浏览网页,更应该选择结构化 API,因为解析 HTML 是脆弱的、慢的、耗费 token 的,而且容易被封锁,而返回不可预测形态的工具,是模型难以妥善推理的工具。要刻意地设计这个工具:少量带元数据的结果、把位置和语言作为参数、保持接口稳定。同时要牢记其局限,因为排名反映的是相关性而非真相,摘要会丢失上下文,结果是值得记录的快照,而且每一次搜索都会在循环中消耗延迟和金钱。

如果你正在构建这一层,SERP API 会返回包含位置处理的解析结果,而对于检索结果背后的页面,按 GB 计费住宅代理可以覆盖智能体在搜索之后进行的抓取工作。

准备好开始了吗?

试用 Shifter 住宅代理,205M+ 个 IP,195+ 个国家,低至 $0.75/GB。

立即开始