グラウンディングとは、言語モデルを「もっともらしく聞こえるもの」から「自分の根拠を示せるもの」へと変えるものだ。グラウンディングされた回答は、その質問がなされた時点で取得された証拠から組み立てられ、使用したソースを指し示すため、読者や別のシステムがそれを確認できる。
ウェブ上で行動するエージェントにとって、ライブなデータへのグラウンディングは選択肢ではない。彼らが扱う問いは、今日の価格、現在の在庫状況、今朝そのページに書かれている内容についてのものだからだ。この解説記事では、グラウンディングとは何か、ライブウェブのグラウンディングループがどのように機能するか、そしてそれが誰にも気づかれずに破綻する箇所について取り上げる。グラウンディングにおいてレジデンシャルインフラが重要である理由については、why LLMs need residential proxies for AI grounding で述べられている。
LLMグラウンディングとは何か、そして何ではないか
| アプローチ | 知識の出所 | 鮮度 | ソースを引用できるか |
|---|---|---|---|
| モデルの知識のみ | 学習データ、重みに固定されている | 学習カットオフの時点と同程度に古い | できない |
| ファインチューニング | 重みに学習させた新しいデータ | 最後の学習実行の時点と同程度に古い | できない |
| プライベートインデックスに対する検索 | あらかじめインデックス化された文書 | 最後のインデックス更新の時点と同程度に新しい | できる |
| ライブウェブのグラウンディング | 回答時に検索・取得されたページ | 最新 | できる |
グラウンディングとは、回答を取得済みの証拠に制約し、それを引用する手法のことだ。自社文書に対する検索も、ライブウェブのグラウンディングも、いずれもこれに該当する。ライブウェブのグラウンディングを特徴づけるのは、証拠が質問がなされたときに取得される点であり、これは時間に敏感な内容、地域性のある内容、あるいは学習データの範囲外の内容にエージェントが対応するために必要なものだ。
グラウンディングループ
エージェントのためのライブウェブのグラウンディングループには、通常7つのステップがある。
- クエリを計画する。 ユーザーのリクエストを1つ以上の検索クエリに変換する。回答が反映すべき市場や言語も含める。
- 検索する。 検索エンジンから候補ソースを取得する。
- 選択する。 どの結果を読むかを選ぶ。一次的で権威のあるソースを優先する。
- 取得する。 ページを取得する。
- 抽出する。 各ページから関連する箇所を抜き出す。
- 引用付きで回答する。 抜き出した箇所から回答を生成し、各主張に引用を付ける。
- 検証する。 各主張が、実際にその引用元の箇所によって裏付けられているかを確認する。
各ステップにはレイテンシの予算がある。検索と取得が支配的であり、複数のソースを並行して取得することが、通常エージェントの応答性を保つ鍵となる。
グラウンディングが破綻する箇所
グラウンディングの失敗の多くは、エラーを生じさせない。それらは、悪い証拠に基づく自信満々の回答を生み出す。
ブロックされたり、チャレンジを受けたりする取得。 チャレンジページや空のシェルを返す取得は、モデルに何も与えない。そして何も与えられないモデルは、その空白を記憶から埋めがちだ。この解決策は、取得の失敗を明示的にすることだ。空のコンテキストを渡すのではなく、「このソースは取得できなかった」ということをモデルに明確に伝え、作り出したソースから回答するよりも、少数のソースで回答することを優先する。
誤った市場や言語。 誤った国から取得されたページは、異なる価格、在庫状況、あるいは異なる製品を表示することがある。エージェントがマドリードのユーザーのために回答しているなら、証拠はマドリードを反映すべきだ。言語やタイムゾーンの信号を出口に合わせることも重要だ。matching proxy geo, timezone and locale を参照。
古いキャッシュ。 取得したページをキャッシュすることは時間とコストを節約するが、質問が必要とする鮮度よりも長く生き残るキャッシュは、静かに昨日の事実を返す。キャッシュの有効期間はクエリの種類ごとに設定し、価格やニュースは短く、参考資料は長くする。
レンダリング後にのみ存在するコンテンツ。 多くのページはJavaScriptでデータを読み込む。単純な取得は、事実を含まない骨組みだけを返す。when you need a web scraping API を参照。
取得したページに隠された指示。 これはエージェントに特有のセキュリティ上の失敗だ。ウェブページには、モデルへの指示に見えるように書かれたテキストが含まれることがある。取得したコンテンツを指示として扱うエージェントは、データを漏洩させたり、ユーザーが求めていない行動を取らされたりする可能性がある。取得したページはすべて信頼できないデータとして扱い、決してコマンドとして扱わないこと。取得したテキストをエージェントの指示から明確に分離し、取得したコンテンツに基づいてエージェントが呼び出せるツールを制限し、重大な結果を伴う行動には確認を求める。
引用のずれ。 引用されたページは、回答が示された後に変わることがある。引用された箇所のスナップショットやハッシュを保持し、引用が確認可能な状態を維持する。
プロキシとAPIがループのどこに関わるか
ループのうち2つのステップが、開かれたウェブに接触する。検索と取得だ。
検索は通常、SERP APIで扱うのが最善だ。これは、エージェントが検索エンジンを閲覧する必要なく、指定された場所やデバイスに対する構造化された結果を返す。その論拠は why AI agents need real-time SERP APIs にある。
取得はプロキシインフラが重要になる箇所だ。エージェントは多数の無関係なサイトから、多くの市場で、しばしば並行して取得を行う。そして最も重要なサイトほど、防御されている傾向がある。ユーザーの市場にあるレジデンシャルの出口は、現地のユーザーが見るページを返す。Shifterのゲートウェイでは、市場とセッションは p.shifter.io:443 に対する認証情報の中で設定される。
customer-USERNAME-country-es-city-madrid:PASSWORD
customer-USERNAME-country-es-city-madrid-sid-task-5521-ttl-600:PASSWORD
最初の行は、リクエストごとに出口をローテーションするもので、複数の独立したソースを並行して取得するのに適している。2番目の行は、10分間1つの出口を保持するもので、整合性が重要な単一サイトでの複数ページにわたるタスクに適している。そのトレードオフについては sticky vs rotating residential proxies にある。
レンダリングされたページについては、ウェブスクレイピングAPIがブラウザ、リトライ、抽出を1つのリクエストで処理し、成功したレスポンスに対してのみ課金する。エージェントインフラの製品ページは proxies for AI agents にあり、プロバイダーを選ぶ基準は best proxies for AI agents that browse the web にある。
鮮度、コスト、レイテンシ
グラウンディングされた回答一つひとつには、いくつかの検索と取得のコストがかかり、それぞれがレイテンシを加える。以下の3つの方法が、両方を制御下に置く。
- 並行して取得すること、そして十分な数の独立したソースが一致した時点で早めに止めること。
- 質問の種類ごとにキャッシュすること。根底にある事実がどれくらい速く変化するかに合わせた有効期間を設定する。
- 一次ソースを優先すること。権威のある1つのページは、それを要約した複数のページに勝る価値がある。
グラウンディングされたエージェントの評価
回答の質だけでなく、グラウンディング自体を直接測定する。
| 指標 | 測定するもの |
|---|---|
| グラウンディング度 | 引用元の箇所によって裏付けられている主張の割合 |
| 引用の正確さ | 引用されたページが実際にその主張を含んでいるかどうか |
| 鮮度 | 時間に敏感な質問に対して証拠がどれだけ新しかったか |
| 取得失敗率 | サイトや市場ごとに、証拠が取得できなかった頻度 |
| 根拠のない回答の割合 | 証拠が欠けているにもかかわらずエージェントが回答した頻度 |
回答が変化する、時間に敏感で市場固有の質問からなるテストセットを構築し、定期的に再実行する。今日は合格するグラウンディングされたエージェントも、ソースがマークアップを変更したために来月失敗することがある。
正しい側に立ち続けること
エージェントは人々の代理としてウェブを閲覧するため、それに応じて振る舞うべきだ。サイトの利用規約やクローラーのルールを尊重し、リクエストの頻度を適切に保ち、ログインやペイウォールを回避せず、何をいつ取得したかの記録を残す。より広い枠組みについては ethical residential proxies for AI data collection にある。
FAQ
グラウンディングは検索拡張生成(retrieval-augmented generation)と同じものか?
検索拡張生成は、グラウンディングを行う一つの方法だ。グラウンディングとは、プライベートインデックスであれライブウェブであれ、回答を取得済みで引用可能な証拠に結びつけるという、より広い実践のことだ。
エージェントがライブウェブのデータにグラウンディングするためにプロキシは必要か?
低いボリュームであれば、必要ないかもしれない。多数のサイトや市場にわたる規模では、単一のアドレスからの取得はスロットリングやブロックを受け、ブロックされた取得は最も一般的な、静かなグラウンディングの失敗である。
ウェブページに隠された指示からエージェントをどう守るか?
取得したコンテンツを信頼できないデータとして扱い、エージェントの指示からそれを分離し、取得したコンテンツが起動できるツールを制限し、重大な結果を伴う行動には確認を求める。
エージェントは検索エンジンを直接閲覧すべきか?
検索のステップにおいては、通常SERP APIの方が速く、安く、信頼性が高い。閲覧は、検索が返したページを取得するために取っておく方が良い。
結論
グラウンディングは、質問がなされた時点で取得された証拠から回答を組み立て、それを引用することで、エージェントの回答を確認可能にする。ループはシンプルだ。計画し、検索し、選択し、取得し、抽出し、回答し、検証する。失敗は静かに起こる。記憶で埋められたブロックされた取得、誤った市場からのページ、古いキャッシュ、レンダリングされていないコンテンツ、隠された指示、そしてずれていく引用だ。
取得の失敗を明示的にし、ユーザーの市場から取得し、質問の種類ごとにキャッシュし、取得したテキストを信頼できないものとして扱い、グラウンディング度を直接測定すること。学習データとグラウンディングのためのデータがどう異なるかについては、how to build large-scale training datasets from the open web を参照。