ナレッジ

ウェブデータセット内のAI生成コンテンツを検出・フィルタリングする方法

単独でAI生成テキストを確実に見抜ける検出器は存在しない。MLチームがプロベナンス、ソース、重複、統計的シグナルを組み合わせてウェブデータセットをフィルタリングする方法。

Chris Collins

Chris Collins

2026年9月18日 · 2 分で読める

今日のあらゆるウェブクロールには、機械生成されたテキストが含まれている。モデルによって書かれた商品ページ、何千も量産されるコンテンツファームの記事、誰も書いていないレビューやフォーラム投稿などだ。多くの用途ではこれは無害である。しかし、学習データ、評価セット、検索コーパスにとってはそうではなく、その割合は増え続けている。

不都合な事実は、生成されたテキストを文書単位で確実に識別できる検出器は存在しないということだ。有効なのは、複数の弱いシグナルを組み合わせ、自分のデータに対して較正し、データセットの用途に合ったポリシーを適用する、多層的なアプローチである。本ガイドでは、そのシグナル、それらを組み合わせる方法、そしてそもそもフィルタリングを可能にするためのデータ収集方法を扱う。

重複排除や来歴を含む、スクレイピングによるデータセット構築の一般的なパイプラインについては、ウェブスクレイピングによるデータセット構築方法 を参照してほしい。本ガイドは生成コンテンツの問題に特化している。

用途別に見る、なぜ重要なのか

データセットの用途生成コンテンツによるリスク一般的な許容度
モデルの事前学習文体の均質化、誤りの増幅、希少な知識の喪失中程度(重み付けを下げることで対応)
評価・ベンチマークモデル出力を反映したテスト項目がスコアを水増しする非常に低い
RAG向け検索コーパス自信ありげだが誤った文章が事実として検索結果に出る重要度の高い回答では低い
市場・ソーシャル分析偽のレビューや投稿が件数や感情分析を歪める低い

学習用途については、この懸念はよく文書化されている。発表された研究では、以前のモデルの出力で繰り返し学習したモデルは、元のデータ分布の希少な部分を失うことが示されており、この失敗はモデル崩壊(model collapse)と呼ばれている。分析用途での懸念はより単純だ。生成されたレビューをもとに構築された感情トレンドは、顧客ではなくマーケティングキャンペーンを測定していることになる。この問題は収集側の観点から ソーシャルプラットフォームのスクレイピングによる感情分析 で扱っている。

単一の検出器では不十分な理由

AIテキスト分類器は文書ごとにスコアを返してくれるため魅力的に見える。しかし実際には、ウェブデータにとって重要な条件においてまさに信頼性を欠く。

  • 短いテキストは判断材料が少なすぎる。
  • 言い換えられた、あるいは軽く編集されたテキストは、しばしば人間によるものとして通過してしまう。
  • 英語以外の言語は通常カバーが不十分である。
  • 一部の人間の文章が過剰にフラグ付けされる。 研究によれば、検出器は非ネイティブの英語話者による文章を、はるかに高い割合で機械生成と誤分類することが分かっている。

主要なAI研究機関の一つは、精度の低さを理由に2023年に自社の公開テキスト分類器を取り下げた。分類器のスコアは、複数ある弱い特徴量の一つとして扱うべきであり、判定結果として扱ってはならない。

組み合わせることでより効果を発揮するシグナル

来歴と時間

最も強力な単一のシグナルは、そもそもテキストの中には存在しない。それは、そのコンテンツが最初に観測された時点である。

生成テキストモデルが一般に広く利用可能になったのは2022年後半である。それ以前に最初に観測されたコンテンツは、分類器が何を言おうと、機械生成である可能性ははるかに低い。それ以降に初めて観測されたコンテンツは自動的に疑わしいわけではないが、事前確率は変化する。

これが機能するのは、観測時刻を記録している場合に限られる。収集の時点で、あらゆる文書について初出タイムスタンプを保存し、あらゆるコピーや変換を通じてそれを保持し、後で密かに書き換えられたページを検出できるよう定期的に再クロールする。観測がいつ、どこで行われたかをデータの一部として扱うべきだという主張は、観測地点という基準 にまとめられている。

ソースレベルのシグナル

生成されたコンテンツは通常、少数の運営者によって大規模に生産されるため、個々の文書よりもソースの方が判断しやすい。個々のページだけでなく、ドメインやセクション単位でスコアを付けるとよい。

  • 公開速度。 月に数ページだったドメインが週に数千ページへと変化した場合。
  • テンプレートの均一性。 多くのページが一つの構造と見出しパターンを共有し、差し替えられているのはトピックだけである場合。
  • 話題の拡散。 単一のサイトが無関係な話題を均一な深さで扱っている場合。
  • 説明責任の欠如。 著者表示がない、Aboutページがない、連絡先情報がない、あるいは架空の署名がある場合。
  • 収益化密度。 アフィリエイトリンクや広告を掲載することを主目的とするページ。

近似重複とテンプレート

コンテンツファームは、同じアウトラインの言い換えを大量に生産する傾向がある。近似重複検出、典型的にはシングル化したテキストに対する局所性鋭敏型ハッシュ(LSH)を用いたMinHashは、こうしたバリエーションをまとめてクラスタ化する。多数のドメインにまたがるほぼ同一のページの大きなクラスタは、大量生産の強力なシグナルであり、クラスタを目視で検査する方が、ページを一つずつ検査するよりもはるかに速い。

このように分析することが見込まれるソースについては、生のHTMLを保持しておく。テンプレート自体が、テキストよりも明確な特徴になることが多いためである。

文書統計量

テキストの統計的性質は、弱い証拠として扱う限りにおいて役立つ。参照言語モデルのもとでの非常に低いパープレキシティ、文の長さや構造のばらつきの小ささ、一般的な定型表現の多用は、いずれも生成テキストと関連付けられる。

これらはいずれも、単純なドキュメント、定型的なニュース速報、非ネイティブの書き手によるテキストなど、一部の人間の文章にもよく見られる。組み合わせてのみ使用し、言語ごとに較正すること。

ウォーターマーク(存在する場合)

一部のモデル提供者は、生成テキストに統計的なウォーターマークを埋め込んでおり、検出ツールを公開しているところもある。ウォーターマークが存在し検出可能な場合、それは強力な証拠となる。ただし、それは参加しているモデルからのテキストしかカバーしておらず、提供者の検出器でしか確認できず、言い換えや翻訳によって弱まる。陽性の結果は意味があるものとして扱い、陰性の結果は情報を持たないものとして扱う。

シグナル強度主な弱点
初出日古いコンテンツに対して強力収集時にタイムスタンプを記録している必要がある
ソースレベルのパターンドメインレベルで強力良質なサイト上の単発的な生成ページは見逃す
近似重複クラスタコンテンツファームに対して強力オリジナルの単発的な生成は見逃す
文書統計量単独では弱い平易な文章や非ネイティブの文章を不当に低く評価する
分類器スコア単独では弱い短い、編集済み、あるいは非英語のテキストに対して信頼性が低い
ウォーターマーク陽性の場合は強力ほとんどのテキストには存在しない

シグナルからフィルタリングポリシーへ

シグナルを組み合わせて文書ごとに一つのスコアとし、ソースレベルのスコアを文書スコアに反映させる。その上で、各スコア帯に対して何をするかを決め、その判断をデータセットの目的に応じて変える。

  • 保持する。 明らかに人間によるものと判定されたか、締め切り日より前に初めて観測された文書。
  • 重みを下げる。 事前学習用の混合データにおいて、境界線上の文書は除去するのではなく重みを下げる。
  • 隔離する。 生成された可能性が高い文書は別のストアに隔離し、フィルタが改善された際に判断を見直せるようにする。
  • 除去する。 評価セットのように汚染が最も大きな損害を与える用途など、用途上どうしても必要な場合に限る。

フィルタにはバージョンを付け、どのバージョンがどのサブセットを生成したかをデータセットのドキュメントに記録する。フィルタとはデータに関する一連の判断であり、後でそのデータセットを使う人は誰でも、その判断が何であったかを知る必要がある。

すべての合成データが望ましくないわけではない。意図的に生成された学習データには正当な用途がある。問題となるのは、ラベル付けされずに紛れ込み、人間の文章と誤認される生成コンテンツである。したがって、自ら合成データを生成する場合は、発生源の時点でラベルを付けること。

フィルタを測定する:誤って除外される対象も含めて

誰も測定していないフィルタは単なる推測にすぎない。

自分のクロールデータからラベル付き検証セットを構築する。人間が書いたと分かっているソースからの文書、対象言語全体にわたって現行モデルを使って自ら生成したサンプル、そして手作業でレビューした境界事例のランダムな一部を用意する。言語ごと、ドメインごとに適合率と再現率を測定する。

その上で、偽陽性を特に監査する。フィルタが非ネイティブ話者による文章、平易な技術文書、あるいは特定の地域の文章を不均衡に除去している場合、それはデータセットを密かに狭めていることになり、後になってそうしたユーザーへのサービスが劣るモデルという形で表面化する。不均衡なデータセットが持つより広範なリスクについては、レジデンシャルプロキシプールはサンプルであり、インターネットそのものではない で扱っている。

評価は定期的に再実行すること。生成器は改善を続けており、前四半期にうまく機能していたフィルタが、誰にも気づかれないまま劣化することがある。

フィルタリングを可能にするための収集

有用なシグナルのほとんどは、収集時点で下される判断に依存している。

  • すべての文書について初出タイムスタンプを記録し、あらゆる変換を通じてそれを保持する。
  • ソースのメタデータを保存する。 ドメイン、セクション、記載されている場合の公開日、そしてそのページを観測した観測地点(vantage point)。
  • テンプレート分析が必要になり得るソースについては生のレスポンスを保持し、パース前に取り込んでおくことで、再収集することなくより優れたフィルタを再適用できるようにする。このパターンは ウェブスクレイピングAPIデータをSQLに移す にある。
  • スケジュールに沿って再クロールし、最初の収集後に書き換えられたページを検出する。
  • 一次的な人間のソースを優先する。 フォーラム、地域サイト、ドキュメント、専門出版物などを、それらを再利用するアグリゲーターよりも優先する。

最良の人間によるソースの多くは、地域限定で強く防御されている。適切な国から、再クロールできるだけの一貫性を持ってそこにアクセスすることこそ、収集インフラが重要になる部分である。Shifterゲートウェイでは、市場はp.shifter.io:443に対する認証情報の中で設定され、セッション識別子を省略するとリクエストごとに出口が変わるため、個別のページ取得に適している。

customer-USERNAME-country-br:PASSWORD

責任を持って収集すること。各サイトの利用規約を尊重し、リクエストレートを適切に保ち、不要な個人データの収集を避ける。より広い枠組みは AIデータ収集のための倫理的なレジデンシャルプロキシ にある。

FAQ

AI生成テキストを確実に検出できるか?

個々の文書については確実には検出できない。ソース、クラスタ、タイムスタンプにまたがる複合シグナルの方が、データセット規模では、いかなる文書単位の分類器よりもはるかにうまく機能する。

学習セットからすべての生成コンテンツを除去すべきか?

必ずしもそうではない。境界線上のコンテンツの重みを下げ、意図的な合成データにラベルを付けることは、通常、多くの人間の文章まで一緒に除去してしまう積極的な削除よりも優れている。

フィルタリングはデータセットの多様性を損なうか?

フィルタが平易な、あるいは非ネイティブの文章を不当に低く評価する場合、損なわれ得る。大規模にフィルタを適用する前に、言語や地域ごとに偽陽性を監査すること。

2022年後半より前のコンテンツは人間による文章として扱って安全か?

それは強力な事前確率ではあるが、保証ではない。それ以前にも自動生成されたコンテンツは存在した。日付を他のシグナルと組み合わせること。

結論

ウェブデータセットからAI生成コンテンツを取り除くスイッチは存在しない。存在するのは、それぞれが何らかの証拠を持つ一連のシグナルである。コンテンツがいつ初めて観測されたか、そのソースがどう振る舞うか、近似重複のクラスタに属しているかどうか、統計量がどう見えるか、そして時にはウォーターマーク。これらを組み合わせ、自分のデータで較正し、データセットの目的に合ったポリシーで適用すれば、機能する。

その大部分は、最初からタイムスタンプ、ソースのメタデータ、生のレスポンスを伴って収集することにかかっている。プロダクトとしての視点は AI・機械学習向けデータ収集 ページにあり、収集の側面は AI学習のためのウェブデータ収集 で扱っている。

始める準備はできていますか?

Shifterのレジデンシャルプロキシをお試しください。IP 205M+件、195+カ国、$0.10/GBから。

始める