レジデンシャルプロキシのインフラは通常、規模の観点で語られる。IP数、国のカバレッジ、都市やASNのターゲティング、そしてローテーション速度である。
これらの問いは重要だ。しかし、市場調査担当者、データサイエンティスト、AIチーム、そして公開ウェブデータを意思決定に利用するすべての人にとって、もう一つ重要な問いがある。得られたデータセットは代表性を持っているか、という問いだ。
英国市場を描写することを意図した10万件の観測データを収集する場面を想像してほしい。すべてのリクエストが成功し、何千ものIPがローテーションするにもかかわらず、その中の不均衡な割合がロンドンと少数の大手ブロードバンドネットワークに由来し、他の地域や小規模ISPはたまにしか現れない。
インフラは機能した。しかしサンプルは機能していなかったかもしれない。厳密に言えば、プロキシプールは利用可能なサンプリングフレームを規定し、そこから選ばれるエグジットと得られる観測データがサンプルを形成する。
この区別が重要なのは、データサンプリングバイアスが失敗したリクエストや壊れたクローラー、明らかに不良なデータを必要としないからだ。個々には有効な観測データが、研究対象の母集団を適切に代表しない割合で収集されたときに、バイアスは生じうる。
統計的サンプリング理論はこの問題を何十年も扱ってきた。NISTは、サンプルに関する事実が自動的に母集団に関する事実になるわけではないこと、そしてサンプルの妥当性は代表性だけでなく、サイズ、変動性、必要な精度にも依存することを指摘している。
主な要点
- 大規模なプロキシプールはアクセスの多様性を生むが、代表性を自動的に生むわけではない。
- サンプリングバイアスは地理、ASN、タイミング、相関する観測地点を通じて生じうる。
- 層別化、割当、時間サンプリング、報告、重み付けによってバイアスを軽減できる。
- ネットワークカバレッジとサンプルカバレッジは異なる問いに答えるものだ。
- アクセスの多様性はサンプルの代表性と同じではない。
ネットワークカバレッジはサンプルカバレッジではない
当社は195カ国以上にわたる2億500万以上のレジデンシャルIPのネットワークを運用しており、国、地域、都市、ASNレベルのターゲティングを提供している。これらの機能は、データチームが公開ウェブを観測できる場所の数を劇的に拡大する。
しかしインフラのカバレッジが説明するのは可能な観測空間である。完成したデータセットがその空間の何割を実際にサンプリングしたかは教えてくれない。
これがネットワークカバレッジとサンプルカバレッジの違いだ。
あるネットワークは何千ものASNを露出させているかもしれないが、一つのクロールでは観測の大半が小さな部分集合を通じて得られることがある。同様に、全国的なカバレッジがあっても、大都市圏でより多くのエグジットが利用可能であれば、都市偏重のデータセットが生じうる。
大規模なプールは多様なサンプリングを可能にするが、それを自動的にはしない。
データサンプリングバイアスがウェブデータセットに入り込む経緯
サンプリングバイアスは不正確な観測データを必要としない。ある製品はある場所で本当に89ドルで、別の場所で本当に93ドルかもしれない。問題が現れるのは、ある環境が何千回も観測され、別の環境がたまにしか観測されないにもかかわらず、集計結果がより広い市場を代表するものとして扱われるときだ。
地理的集中。 全国規模のデータセットは、人口密度の高い都市や地域を不均衡に反映することがある。
ASNまたはISPの集中。 多くの異なるレジデンシャルIPであっても、比較的少数のブロードバンドネットワークに由来することがありうる。
時間的バイアス。 特定の時間、曜日、期間に集中した収集は、サイクルの他の部分にある意味のある変動を見逃す可能性がある。
可用性バイアス。 レジデンシャルエグジットは動的であるため、ある瞬間に利用可能なアドレスが、後になって利用可能なものの分布を反映しない場合がある。
繰り返し環境バイアス。 異なるIPアドレスは、同じISP、都市、より広いネットワーク環境を共有している場合、必ずしも独立した観測環境とは限らない。
これは重要な運用上の区別につながる。リクエストの失敗はインフラの問題だ。サンプリングバイアスは、すべてのリクエストが成功していても存在しうる。
当社のベンチマークが測定期間の重要性を示している
当社のレジデンシャルプロキシベンチマークは、見出しとなるネットワーク数値がなぜ文脈を必要とするかを示している。公表されているプールサイズのみに頼るのではなく、当社は定義されたテスト期間中に稼働してアクセス可能なIPを測定する。
DataImpulseベンチマークから、ネットワークあたり25万リクエストの米国実行の例を挙げる。
| 米国テスト、各25万リクエスト | Shifter | DataImpulse |
|---|---|---|
| 観測された稼働IP | 136,667 | 86,976 |
| 個別ASN数 | 1,606 | 967 |
| 個別都市数 | 5,813 | 4,513 |
| 成功率 | 99.8% | 99.6% |
方法論は結果と同じくらい重要だ。この数値は、テスト期間中に稼働してアクセス可能だったIPを表しており、レジデンシャルエンドポイントがプールに出入りする丸一日の間に各ネットワークが提供しうるすべてのアドレスを表すものではない。
これがサンプリング的な思考だ。測定には母集団、期間、量、方法論がある。1,606のASNに到達することは広範な潜在的カバレッジを示すが、各ASNが寄与した観測データの割合は示さない。
次のステップは、ネットワークの広がりだけでなく、実際の観測データがその中でどのように分布していたかを測定することだ。アクセスの多様性とサンプルの代表性は同じものではない。広いプロキシプールは可能な観測地点を生み出す。収集の設計が、データセットに最終的に残る分布を決定する。
まず何を代表させようとしているのかを定義する
データセットが代表性を持つかどうかを問う前に、より根本的な問いがある。何を代表するのかということだ。普遍的に正しいプロキシ分布というものは存在しない。
小売価格を監視しているなら、対象母集団は小売業者が事業を展開している地域かもしれない。広告検証では、母集団は都市、ISP、デバイスタイプ、時間帯の組み合わせかもしれない。ローカライズされた検索分析では、意味のあるサンプリング単位は単に英国のIPアドレスではなく、位置×デバイス×検索エンジン×時間帯かもしれない。
当社のSERP APIが都市レベルのジオターゲティングとデスクトップまたはモバイルの検索結果をサポートしているのは、ある利用者が経験するSERPが、別の場所で経験されるSERPを必ずしも代表しないためだ。
全国的な研究は人口加重の地理を使うかもしれないが、別のプロジェクトでは主要な商業地域からの均等な代表性が必要になるかもしれない。研究目的が最初に来なければならない。
「10万件の英国リクエストを収集する」と言う代わりに、より良いデータ設計の問いはこうだ。その10万件のリクエストはどの英国の観測環境を、どのような割合で代表すべきか。
プロキシサンプルを層別化する
古典的なサンプリング理論からの有用な考え方の一つが層別サンプリングだ。観測空間を意味のあるグループに分割し、一つの未分化な全国プールから抽出するのではなく、各グループに対して意図的に収集を行う。
英国全体のデータセットの場合、地理的層にはロンドン、サウスイースト、ミッドランズ、ノースウェスト、ノースイースト、スコットランド、ウェールズ、北アイルランドが含まれるかもしれない。これらの地理的グループは、さらにASNやISPによって細分化できる。
収集計画は、ローテーションが自然に供給するエグジットをそのまま受け入れるのではなく、すべての重要な地域内で複数の自律システムからの観測データを必要とすると明記できる。ここでインフラレベルのターゲティングが統計的に有用になる。当社のレジデンシャルプロキシインフラは地域、都市、ASNのターゲティングをサポートしているため、チームはこれらの制御をアクセスのためだけでなく、収集方法論自体の一部として利用できる。
目標とする割合は均等である必要はない。研究者は人口、店舗の展開状況、顧客分布、キャンペーンの支出、あるいは稀な条件が重要な場合には小規模市場を意図的にオーバーサンプリングすることもある。
重要なのは、ある分布が正しいということではない。重要なのは、その分布が意図的であるべきだということだ。
すべての層に割当を設ける
層別化は、割当と組み合わされたときに運用可能になる。クローラーが全体のリクエスト目標に達するまでエグジットを取得し続けることを許すのではなく、サンプリングを意識したパイプラインは、収集が始まる前に上限と最小値を定義できる。
例えば、ASNの集中に上限を設け、優先地域ごとの最小件数を設定し、重要な都市内で複数の独立したASNを要求する。
ある割当が満たされると、収集は代表性の低い層へシフトできる。ローテーションは依然として重要だが、それはサンプリング設計の内部で機能するのであり、それ自体で適切な分布を作り出すことを期待されるわけではない。
こうしてプロキシの選定はデータ品質管理の一部となる。
時間もサンプルの一部である
地理は変動の一つの源にすぎない。時間も重要だ。午前9時から正午の間だけに収集されたデータセットは、24時間サイクル全体でサンプリングされたものと同じ世界を描写しているとは限らない。
これは旅行価格、配達可用性、マーケットプレイスの在庫、検索広告、プロモーション、動的価格設定、検索結果の変化にとって重要になりうる。
これらのユースケースでは、収集の時間帯自体が層になるべきだ。朝、午後、夕方、深夜にはそれぞれ割当が設定されるかもしれない。より長期の研究では、平日と週末のサンプリング、あるいは複数日にわたって繰り返される観測が必要になるかもしれない。
これが特に重要なのは、プロキシの可用性自体が時間に依存しうるからだ。ネットワークを通じてアクセス可能なレジデンシャルデバイスの構成は、利用者、接続、デバイスが出入りするにつれて変化する。したがってプロキシのエグジットは単なる地理的観測地点ではない。それは空間と時間における観測地点なのだ。
分布を報告する、量だけではなく
ほとんどの収集サマリーは規模を強調する。処理されたリクエスト数、収集されたページ数、使用されたIP数。これらの数値は量を示すが、得られたデータセットが意図した母集団を適切に代表しているかどうかは示さない。
我々は、本格的なウェブデータセットがサンプルカバレッジレポートに近いものを次第に持つべきだと考えている。
| 指標 | 報告すべき内容 | 重要な理由 |
|---|---|---|
| 地理的分布 | 国、地域、都市ごとの件数 | 観測の地理を示す |
| ASN分布 | 固有ASN数と集中度 | ネットワークの偏りを示す |
| 時間的分布 | 時間帯ごとの観測データ | 時間帯の集中を示す |
| デバイス分布 | 関連するデバイスプロファイルごとの割合 | デバイスのバランスを示す |
| 収集品質 | 成功率と繰り返しエグジットの集中度 | 配信と多様性を切り分ける |
| カバレッジの空白 | 欠落または不足している層 | 代表性の不足を明示する |
これはより広い原則を反映している。プロベナンスは、データがどこから来たかだけでなく、どこから、いつ観測されたかも説明すべきだということだ。この議論は観測地点標準のためのケースで詳しく述べられている。
ネットワークカバレッジは、インフラがどこを観測できたかを示す。サンプルカバレッジは、データセットが実際にどこを観測したかを示す。データチームは次第に両方を必要としている。
管理された収集パイプラインについては、当社のWeb Scraping APIがプロキシローテーション、ブラウザレンダリング、CAPTCHA解決、リトライを処理する。次の方法論的な層は収集設計自体に属する。すなわち、成功した観測データがどのように分布すべきかを決めることだ。
重み付けは不均衡を補正できるが、限界がある
サンプリング設計が完璧になることは決してない。そこで重み付けが役立つ。ロンドンが目標とする分布の20%を占めるべきなのに観測データの40%を生み出している場合、アナリストはその影響を減らし、代表性の低い地域により大きな重みを与えることができる。
米国国勢調査局は、サンプル単位が異なる選択確率を持つ可能性があること、そして回答率とカバレッジがサブ母集団ごとに異なることを説明している。重み付けはこの差異のある代表性を補正し、推定値が対象母集団により良く関連するようにする。
しかし重み付けには限界がある。関連する地域が欠落している場合、いかなる調整も、決して収集されなかった観測データを作り出すことはできない。観測データが存在する場合でも、重み付けは、研究者がなぜグループが過大または過小に代表されたのかを理解しているときに最もうまく機能する。
Pew Research Centerによるオンライン非確率サンプリングに関する研究は、有用な類似例を提供している。募集、選定、実施、重み付けの方法は推定値に大きな影響を与えうるし、より強固なサンプリングと重み付けの手順は一部の結果を改善しうる。
調査回答者はレジデンシャルプロキシIPではないが、方法論的な教訓は転用可能だ。大規模なサンプルであっても、それがどのように構築されたかを理解する必要性はなくならない。
プロキシ業界は効果的なサンプルカバレッジの考え方を必要としている
レジデンシャルプロキシインフラを評価するチームは通常、プールサイズ、国、成功率、レイテンシ、ローテーション、ジオターゲティング、ASNカバレッジについて尋ねる。我々は、サンプル品質に関する問いもそれらと並んで扱われるべきだと考えている。
- 観測の集中度。 実際に受け取った観測データはどの程度集中していたか。
- ネットワークの参加度。 いくつの独立したASNがデータセットに有意に寄与したか。
- 地理的バランス。 どの層が過大に代表され、過小に代表され、あるいは欠落していたか。
- 時間的安定性。 収集期間中に観測分布は変化したか。
- 調整の負担。 サンプルを目標分布に合わせるために事後にどれだけの重み付けが必要か。
これらの答えをまとめて効果的なサンプルカバレッジと呼ぶことができるだろう。それは単一の普遍的なスコアになるべきではない。カバレッジの適切な定義は研究の問いに依存する。
あるプロジェクトでは都市のカバレッジが優先されるかもしれず、別のプロジェクトではASNの多様性、時間的カバレッジ、デバイス分布がより重要かもしれない。重要なのは、IPアドレスが多ければ自動的に統計的サンプルが良くなるという前提を超えて進むことだ。
より大きなネットワークの広がりは、より多くのサンプリングの可能性を生み出す。代表性は依然として、そのインフラがどのように使われるかに依存する。
プロキシインフラから観測インフラへ
レジデンシャルプロキシは、価格設定、AIデータセット、市場インテリジェンス、検索分析、ブランドモニタリング、広告検証のための分析パイプラインにますます供給されており、そこでは収集されたデータが、要求された個々のページよりも大きな何かを説明するために使われる。
これはウェブデータインフラの基準を変える。問いはもはや「この市場にアクセスできるか」だけでなく、「どのように観測したかを弁護できるか」でもある。
Shifterでは、大規模なプール、広範なASNカバレッジ、正確なジオターゲティング、信頼できるローテーションが依然として基盤であると考えている。これらは観測空間を作り出すが、それは方法論の始まりであって、終わりではない。
レジデンシャルプロキシプールは可能な観測地点を提供し、ローテーションはその中から選択する。どちらも、最終的な観測データが測定を意図した世界を代表することを保証しない。
そのためには、意図的なサンプリング、割当、時間を意識した収集、分布の報告、そして適切な場合には統計的な重み付けが必要になる。アクセスの多様性とサンプルの代表性は同じものではない。次世代のウェブデータインフラは、その両方を測定できるようにすべきだ。プランと料金は料金ページに掲載されている。