オルタナティブデータ、すなわち従来の財務報告書の外側に存在するウェブ由来のシグナルは、ヘッジファンド、資産運用会社、株式アナリストにとって中核的なインプットとなっている。商品価格や在庫水準、求人投稿の速度、アプリストアのレビューやランキング、マーケットプレイスの出品情報、プロモーションのペース。これらのシグナルを正しく、かつ早期に読み取れば、決算発表に先んじることができる。この優位性は本物だが、それは完全にひとつの脆い前提の上に成り立っている。収集したデータが、実際の顧客が実際に目にするものと同じであるという前提だ。
その前提は、静かに崩れる。ウェブ上のシグナルは地域ごとにパーソナライズされ、アンチボットシステムによって守られており、時系列として完全でクリーンである場合にのみ取引材料として使える。データセンターのIPや単一のロケーションから収集すれば、歪んで欠損だらけの像しか得られない。それはデータのように見えて、市場を反映していない。ここで登場するのがレジデンシャルプロキシだ。これによりリサーチチームは、実在する現地のユーザーとまったく同じようにウェブ上のシグナルを収集できるようになる。そしてそれこそが、オルタナティブデータを実際に資金を投じられるものに変える唯一の方法だ。
オルタナティブデータ収集の実際の中身
オルタナティブデータのリサーチとは、本質的には、公開されたウェブ全体から非伝統的なシグナルを体系的に収集し、モデルが取引材料にできる時系列に変換する作業である。よくあるソースは以下の通り。
- 価格と在庫 — 小売業者やマーケットプレイス全体における商品価格、割引の深さ、在庫水準。これは需要と収益を直接読み取る指標となる。(この分野は価格モニタリングのためのレジデンシャルプロキシと重なる。)
- 採用シグナル — 企業の拡大や縮小を示す代理指標としての求人投稿数と、その速度。
- 消費者のセンチメントとエンゲージメント — アプリストアのランキングとレビュー、評価の推移、大規模な製品フィードバック。
- マーケットプレイスと出品の動向 — 企業が依存するプラットフォーム上での供給、売れ行き、品揃えの変化。
- ウェブ上の露出とプロモーション — 価格ページの変更、キャンペーンのペース、戦略を示唆するカタログの変化。
これらすべては、実在するユーザーに実際の市場で実際に公開されているものを捕捉することにかかっている。そして何が公開されるかは、サイトが訪問者を誰だと認識するかに完全に依存している。
なぜこれがプロキシの問題なのか
ウェブ由来のシグナルが持つ3つの性質によって、オルタナティブデータの収集はプロキシ層に直結するデータ品質の問題となる。この分野では、データ品質そのものが製品なのだ。
シグナルは地域ごとにパーソナライズされている。 価格、在庫の有無、ランキング、さらにはどの商品が存在するかまでもが、国や地域によって異なる。ある小売業者は米国の買い物客とドイツの買い物客に異なる価格を提示する。アプリのランキングはストアごとに異なる。すべてを一箇所から収集すれば、グローバルな仮説をモデル化しているつもりで、実際には一つの市場だけを測定していることになり、これがシグナルを静かに損なう微妙なバイアスとなる。各市場で実際の顧客が目にするものを見るには、その市場から収集する必要がある。(都市レベルのターゲティングが重要になるときは、地域ごとに価格設定される商品にも当てはまる。)
ソース側は自動アクセスを防御している。 データを取得している小売業者、マーケットプレイス、アプリストアは、強力なアンチボットシステムを稼働させている。データセンターのIPは即座に検知され、CAPTCHAやブロック、あるいは実際のユーザーとは異なるページを表示される。つまり記録されるのはシグナルのボット版であり、本物ではない。(スクレイパーがブロックされる理由にその仕組みが解説されている。)取引シグナルにとって、これはデータがないより悪い。事実として提示された誤ったデータだからだ。
時系列としての完全性がすべてを左右する。 取引可能なシグナルとは、クリーンで連続した時系列のことだ。同じSKU群、出品群、企業群を、同じ方法で日々測定し続ける必要がある。多数のソースと市場にまたがってそれを収集するには膨大なリクエスト数が必要になる。少数のIPからではレート制限に引っかかり、部分的で偏ったサンプルしか得られない。そして時系列には、ソース側が拒否したまさにその箇所に欠損が生じる。それはバックテストを台無しにする類の不連続性だ。
この3つすべてに対する解決策は同じだ。実在する現地のユーザーに見えるIPから、仮説に含まれるすべての市場にわたって、完全かつ継続的に収集することである。
レジデンシャルプロキシがどこで役立つか
レジデンシャルプロキシは、収集リクエストを実在する一般消費者のIPを経由させることで、ソース側があなたを本物の現地の顧客と同じように扱って応答するようにする。オルタナティブデータにおいて、これは同時にいくつものことを可能にする。
ボット版ではなく、本物のシグナル。 レジデンシャルIPは実ユーザーとしての信頼性を持つため、疑わしいトラフィックに提供される劣化版やブロック版ではなく、実際の顧客が目にする価格、ランキング、出品情報を捕捉できる。これは、ポジションの規模を決められるシグナルと、データを装ったノイズとの違いだ。
市場ごとの地理的に正確な収集。 国や都市レベルまでのジオターゲティングにより、各シグナルをそれが属する市場のユーザーとして収集できる。米国の価格は米国から、ドイツの在庫状況はドイツから、それぞれ観測地点によってラベル付けされる。これにより、クロスマーケットの仮説がクロスマーケットのデータに基づくようになり、一箇所のデータを外挿したものではなくなる。
完全で連続した時系列。 大規模なローテーティングプールによってリクエストを分散させることで、ブロックやレート制限を受けることなく、時間をかけて多数のソースと市場を測定できる。これにより時系列は欠損だらけではなく連続的になり、バックテスト可能になる。(データ収集のためのレジデンシャルプロキシと同様の収集品質の原則が当てはまる。)
つまり、レジデンシャルプロキシは「たまたまスクレイピングできた数字」を「実際の顧客が、あらゆる場所で、毎日目にする数字」に変える。この信頼性こそがこの仕事の成否を左右する。なぜなら資金を動かす判断において基準となるのは、防御可能なデータだからだ。(ここでレジデンシャルがデータセンターより優れている理由については、レジデンシャルプロキシとデータセンタープロキシの比較を参照。)
仕組み
Shifterのゲートウェイでは、プロキシのユーザー名に市場情報をエンコードすることでターゲットを指定できる。エンドポイントは1つで、IPリストを管理する必要はない。
# 米国の買い物客として小売業者の価格を収集する
curl -x customer-USERNAME-country-us:PASSWORD@p.shifter.io:443 https://retailer-or-marketplace.example
# 価格や在庫が地域単位の場合は都市レベルまで絞り込む
curl -x customer-USERNAME-country-de-city-berlin:PASSWORD@p.shifter.io:443 https://retailer-or-marketplace.example
幅広く継続的な収集にはプールをローテーションさせ、ソースが複数ステップのフロー全体で一貫したアイデンティティを必要とする場合はスティッキーセッションを使う。同じゲートウェイでリクエストごとに異なるターゲティングを行い、データチームが運用する収集・モデリングパイプラインに供給する。プールの品質が提供される内容を左右するため、IPレピュテーションを理解しておくと時系列をクリーンに保つ助けになる。これらのシグナルをリサーチ用のパネルに組み立てる方法については、ウェブスクレイピングでデータセットを構築する方法が構造化の側面をカバーしている。
責任を持って利用する
オルタナティブデータの収集は一般公開されている情報、つまりどの顧客でも見ることができる価格、出品情報、ランキングを対象とする。これによって法的な基盤は確かなものになるが、それでも責任を持って行うべきだ。公開データのみを収集し、各ソースの利用規約とレート制限を尊重し、問い合わせ先のサービスを劣化させないこと、そして個人データや非公開の情報には十分距離を置くこと。これはこの分野におけるマテリアル・ノンパブリック・インフォメーションやコンプライアンス上の理由からも重要である。プロキシはリクエストの発信元IPを変えるだけであって、そのリクエストを行うべきかどうかを変えるものではない。Shifterで許可されている内容については、利用規約が正式な基準となる。
FAQ
なぜオルタナティブデータにレジデンシャルプロキシが必要なのか? ウェブ上のシグナルは地域ごとにパーソナライズされ、防御されているためだ。単一のロケーションやデータセンターIPからでは、一つの市場のデータ(あるいはブロックやCAPTCHA版)しか見えず、時系列に偏りが生じたり壊れたりする。レジデンシャルプロキシを使えば、仮説に含まれるすべての市場にわたって、実在する現地の顧客が目にする本物の地理的に正確なシグナルを収集できる。
プロキシなしでスクレイピングしたデータでは不十分なのか? 正確かつ完全であれば十分だが、レジデンシャルIPなしではたいてい不十分である。データセンターからの収集ではフォールバックページやブロックページを提供され、単一ロケーションからの収集では地域ごとのパーソナライズを見落とす。取引シグナルにとって、それは誤ったデータであり、データがないより悪い。
プロキシはどのようなシグナルの収集に役立つのか? 価格と在庫、採用と求人投稿の速度、アプリのランキングとレビュー、マーケットプレイスの出品と売れ行き、プロモーションのペースなど、地域ごとにパーソナライズされているか防御されている公開ウェブ上のシグナルであれば、どれもレジデンシャル収集の恩恵を受ける。
投資リサーチにはレジデンシャルとデータセンター、どちらのプロキシが適しているか? レジデンシャルである。ソース側はデータセンターのIPを検知し、異なる扱いをするため、データセンターでは歪んだ、あるいはブロックされた像しか得られない。レジデンシャルIPは実際の顧客が目にする本物の、地理的に正確なデータを見ることができ、それこそが取引可能なシグナルに求められる基準だ。
オルタナティブデータの収集は合法か? オルタナティブデータは一般的に公開情報を対象としており、責任を持って行う限り(利用規約とレート制限を尊重し、個人データを避ける)、概ね問題ない。この分野には非公開情報に関するコンプライアンス上の考慮事項も存在する。プロキシは背後にある活動の合法性を変えるものではない。不確かな点については法務・コンプライアンスの助言を得ること。
結論
オルタナティブデータが優位性となるのは、データが正しい場合に限られる。そしてウェブ由来のシグナルは地域ごとにパーソナライズされ、防御されており、時系列に欠損が生じた瞬間に価値を失う。モデル化しようとしている市場は一つのオフィスのIPからは見えないため、取引するすべての市場において、実在する現地の顧客として、完全かつ継続的に収集する必要がある。これこそがレジデンシャルプロキシが提供するものだ。ボット版ではなく本物のシグナル、地理的に正確なカバレッジ、そしてバックテスト可能な途切れのない時系列である。
あなたのファンドやリサーチチームがウェブからシグナルを構築しているなら、質の高いレジデンシャルプロキシネットワークは、データを単に豊富なものではなく防御可能なものにするアクセス層となる。プールの品質が時系列の完全性とクリーンさを決めるため、評価の際にはIPレピュテーションを理解しておく価値がある。料金ページにはGB単位のプランが用意されており、仮説が依存するソースや市場に対して試すことができる。