知识

如何检测和过滤网络数据集中的AI生成内容

没有一种检测器能够单独可靠地识别AI生成文本。机器学习团队如何结合来源、出处、重复及统计信号来过滤网络数据集。

Chris Collins

Chris Collins

2026年9月18日 · 2 分钟阅读

现在每次网页抓取都会包含机器生成的文本:由模型撰写的产品页面、按千篇生产的内容农场文章、没有任何人写过的评论和论坛帖子。对许多用途来说这无关紧要。但对训练数据、评估集和检索语料库而言并非如此,而且这一比例还在不断增长。

一个令人不安的事实是,没有任何检测器能够逐篇文档可靠地识别生成文本。真正有效的是分层方法:结合多个弱信号,针对你自己的数据进行校准,并采用与数据集用途相匹配的策略。本指南将介绍这些信号、如何组合它们,以及如何进行数据采集才能使过滤变得可行。

构建抓取数据集的通用流程,包括去重和溯源,参见如何通过网页抓取构建数据集。本指南专门聚焦于生成内容这一问题。

为何重要:按用例区分

数据集用途生成内容带来的风险典型容忍度
模型预训练风格趋同、错误被放大、稀有知识的流失中等,可通过降权处理
评估与基准测试与模型输出相呼应的测试项会抬高分数极低
用于 RAG 的检索语料库自信但错误的段落会被当作事实检索出来对高风险答案而言很低
市场与社交分析虚假评论和帖子会扭曲统计数量和情感倾向

对于训练而言,这一担忧已有充分记录。已发表的研究表明,反复用早期模型的输出训练模型,会导致原始数据分布中较为稀有的部分逐渐流失,这种失效现象被称为模型崩溃(model collapse)。对分析而言,问题则更为直接:建立在生成评论之上的情感趋势衡量的是一场营销活动,而不是真实客户。这一问题从数据采集角度在抓取社交平台以进行情感分析中有所涉及。

为何单一检测器不够用

AI 文本分类器很有吸引力,因为它们能为每篇文档返回一个分数。但在实际应用中,恰恰在网页数据最重要的那些情形下,它们并不可靠。

  • 短文本给它们提供的信息太少。
  • 经过改写或轻度编辑的文本往往能被误判为人类撰写。
  • 非英语语言通常覆盖度较差。
  • **部分人类写作被过度标记。**研究发现,检测器将非英语母语者的写作误判为机器生成的比率要高得多。

一家主要的 AI 实验室在 2023 年撤下了自己公开的文本分类器,理由是准确率过低。应将分类器分数视为若干弱特征之一,而绝不能当作最终判定。

组合使用效果更好的信号

溯源与时间

最强的单一信号根本不在文本本身之中,而是内容首次被观察到的时间。

生成式文本模型于 2022 年末开始广泛向公众提供。在此之前首次被观察到的内容,无论分类器给出何种判断,都极不可能是机器生成的。此后首次出现的内容并不因此自动可疑,但先验概率发生了变化。

这只在你记录了观察时间的情况下才有效。在采集时为每篇文档存储首次发现的时间戳,在每次复制和转换中都保留它,并定期重新抓取,以便能够检测到之后被悄悄改写过的页面。将观察发生的时间和地点作为数据一部分来处理的理由,在视角点标准中有详细说明。

来源层面的信号

生成内容通常是由少数运营者大规模生产的,这使得来源比单篇文档更容易判断。应对域名和板块打分,而不仅仅是单个页面。

  • **发布速度。**一个域名从每月几篇突然变成每周数千篇。
  • **模板一致性。**许多页面共享同一结构和标题模式,仅在主题上有所替换。
  • **主题泛滥。**同一网站以统一深度覆盖毫不相关的主题。
  • **缺乏问责信息。**没有作者信息、没有关于页面、没有联系方式,或使用虚构的署名。
  • **变现密度高。**页面主要用于承载联盟链接或广告而存在。

近重复内容与模板

内容农场往往会产出同一提纲的大量改写版本。近重复检测(通常使用 MinHash 结合局部敏感哈希对分片文本进行处理)可以将这些变体聚类在一起。跨多个域名出现的大规模近似重复页面集群,是批量生产的有力信号,而对集群进行人工检查,比逐页检查要快得多。

对于你预计要以此方式分析的来源,应保留原始 HTML,因为模板本身往往比文本更能构成清晰的特征标志。

文档统计特征

文本的统计属性可以提供帮助,但只应作为弱证据处理。在参照语言模型下极低的困惑度(perplexity)、句长与结构上的低变化性,以及大量使用泛泛而谈的套话措辞,都与生成文本相关。

这些特征在部分人类写作中同样常见:简单的文档说明、格式化的新闻简讯,以及非英语母语者所写的文本。只应组合使用这些特征,并按语言分别校准。

水印(如存在)

一些模型提供商会在生成文本中嵌入统计水印,其中部分已发布检测工具。当水印存在且可检测时,这是有力的证据。但它只覆盖参与该机制的模型所生成的文本,只能用提供商自己的检测器来核实,而且改写或翻译会削弱其效果。应将检测为正的结果视为有意义,将检测为负的结果视为无信息量。

信号强度主要弱点
首次发现日期对较旧内容而言较强需要在采集时记录时间戳
来源层面模式在域名层面较强会漏掉正规网站上的一次性生成页面
近重复集群对内容农场较强会漏掉原创的一次性生成内容
文档统计特征单独使用时较弱会惩罚朴素和非英语母语的写作
分类器分数单独使用时较弱对短文本、经编辑或非英语文本不可靠
水印检测为正时较强大多数文本中不存在

从信号到过滤策略

将各信号组合成每篇文档的单一分数,来源层面的分数应输入到文档分数中。然后针对每个分数区间决定处理方式,并让这一决定取决于数据集的用途。

  • 保留明显判定为人类撰写或首次发现时间早于你设定截止日期的文档。
  • 在预训练混合数据中对处于边界的文档降权,而不是直接移除。
  • 将可能为生成内容的文档隔离存放在单独的存储中,以便日后过滤器改进时可以重新审视这一决定。
  • 只在用例确实要求时才丢弃,例如评估集,因为污染在其中造成的损害最大。

对过滤器进行版本管理,并在数据集文档中记录哪个版本生成了哪个子集。过滤器本质上是一组关于数据的决策,任何日后使用该数据集的人都需要知道这些决策是什么。

并非所有合成数据都是不受欢迎的。有意生成的训练数据有其正当用途。问题在于未加标注、被误认为人类写作的生成内容,因此当你自己生成合成数据时,应在源头就对其进行标注。

衡量过滤器,包括它错误排除的对象

一个从未被衡量过的过滤器,只是一个猜测。

从你自己的抓取数据中构建一个带标签的验证集:来自已知为人类撰写来源的文档、你用当前模型在目标语言范围内自行生成的样本,以及经人工审核的边界案例随机样本。按语言和按域名分别衡量精确率和召回率。

然后专门审计误判为正例的情况。如果过滤器不成比例地移除了非英语母语者的写作、朴素的技术文档,或特定地区的内容,它就在悄悄缩窄数据集,而这种缩窄之后会体现为模型对这些用户群体服务效果更差。关于数据集失衡的更广泛风险,在你的住宅代理池是一个样本,而不是整个互联网中有所涉及。

应定期重新评估。生成器在不断改进,而上一季度还有效的过滤器可能在无人察觉的情况下逐渐失效。

采集方式要使过滤成为可能

大多数有用的信号取决于采集时所做的决策。

  • 为每篇文档记录首次发现的时间戳,并在每次转换中予以保留。
  • 存储来源元数据:域名、板块、声明的发布日期,以及观察该页面所使用的视角点。
  • 保留原始响应以备日后需要分析模板的来源使用,并在解析之前先落盘存储,这样更好的过滤器就能在无需重新采集的情况下被重新应用。相关模式见将网页抓取 API 数据导入 SQL
  • 按计划重新抓取,以检测首次采集之后被改写过的页面。
  • 优先选择人类原创来源:论坛、地区性网站、文档说明和专业出版物,而非二次转载它们的聚合网站。

许多最优质的人类写作来源都具有地区性且防护严密。能够从正确的国家访问它们,并保持足够稳定的重新抓取频率,正是采集基础设施发挥作用之处。使用 Shifter 网关,市场设置在凭据中,针对 p.shifter.io:443,省略会话标识符则会为每次请求轮换出口,这适合独立的页面抓取:

customer-USERNAME-country-br:PASSWORD

负责任地采集:遵守每个网站的条款,保持请求速率合理,避免采集不必要的个人数据。更广泛的框架在用于 AI 数据采集的合乎道德的住宅代理中有所说明。

常见问题

能否可靠地检测出 AI 生成的文本?

对单篇文档而言无法可靠检测。在数据集层面,跨来源、跨集群和跨时间戳组合信号的效果,远胜于任何逐篇文档的分类器。

是否应将训练集中所有生成内容都移除?

不一定。对边界内容进行降权处理,并对刻意生成的合成数据加以标注,通常比激进式移除更好,因为激进移除同时也会移除大量人类写作。

过滤会降低数据集的多样性吗?

如果过滤器惩罚朴素或非英语母语的写作,确实可能如此。在大规模应用过滤器之前,应按语言和地区审计误判为正例的情况。

将 2022 年末之前的内容视为人类撰写是否安全?

这是一个较强的先验判断,但不是保证。更早期的自动化内容同样存在。应将日期与其他信号结合使用。

结论

没有一个开关能把 AI 生成内容从网页数据集中移除。存在的是一组各自携带部分证据的信号:内容首次被观察到的时间、其来源的行为方式、它是否属于某个近重复集群、其统计特征如何,以及偶尔出现的水印。将这些信号组合起来,针对你自己的数据进行校准,并采用与数据集用途相匹配的策略,它们就能发挥作用。

其中大部分都依赖于从一开始就以时间戳、来源元数据和原始响应的方式进行采集。产品层面的介绍见AI 与机器学习数据采集页面,采集层面的内容见为 AI 训练采集网页数据

准备好开始了吗?

试用 Shifter 住宅代理,205M+ 个 IP,195+ 个国家,低至 $0.10/GB。

立即开始