ガイド、チュートリアル& インサイト
Shifterチームが提供するレジデンシャルプロキシ、ウェブスクレイピング、データ収集戦略、業界のベストプラクティスについて学ぶ。
Selenium でレジデンシャルプロキシを使う方法(認証付きプロキシを含む)
Selenium はプロキシホストの設定は簡単に行えますが、認証情報を渡す組み込みの方法がありません。Selenium Wire、拡張機能、または CDP を使って認証付きプロキシを扱う方法を解説します。
ページネーションと無限スクロールを大規模かつ確実にスクレイピングする方法
ページネーションはスクレイパーが気づかぬうちにデータを失う箇所だ。ページの飛ばし、重複カウント、途中終了などが起こる。すべての項目を一度だけ取得し、完了したことを正しく判定する方法を解説する。
Shifter vs Decodo: 5カ国で稼働中の全IPを数えてみた
Shifterは$0.75/GBから、Decodoは$2.75。5カ国でそれぞれ560,000件のリクエストを送信し、ユニークな出口IPをすべて数えた。完全な結果と手法はこちら。
Puppeteerでレジデンシャルプロキシを使う方法(page.authenticateを含む)
Puppeteerにおけるプロキシ: プロキシはlaunch argsで指定し、認証情報はpage.authenticateで渡し、1つのゲートウェイを通じてページ単位でジオローテーションを行い、リソースをブロックする。
スクレイピングパイプラインの監視: データが壊れる前に異常を教えてくれる指標
スクレイパーは静かに失敗する。cronは動き、ログは200を返し、それでもデータは間違っている。それを役員会議室ではなくパイプラインの中で捉える指標とアラート。
2026年におけるWebスクレイピングの現状
AIによってデータ収集は戦略的なものとなり、アンチボット対策はネットワークレベルへと移行し、ブロックは見えないものとなり、価格設定は帯域幅ベースへとシフトした。2026年におけるWebスクレイピングの現状を見る。
C#でHttpClientを使ってレジデンシャルプロキシを利用する方法
C#におけるプロキシ:NetworkCredentialを使ったWebProxy、SocketsHttpHandlerとPooledConnectionLifetime、IHttpClientFactory、そしてジオローテーション用のID別クライアント
自前構築か購入か:スクレイピング基盤は自社で運用すべきか
デモ用のスクレイパーを作るのは半日仕事だ。しかしそれをスケールさせて運用するのはプロダクトそのものになる。何を自社で構築し、何を購入し、そしてどの層だけは常に借りるべきかを判断するためのフレームワーク。
サイトが偽のコンテンツやブロックされたコンテンツを表示しているかを見分ける方法
危険なスクレイピングの失敗は目に見える403ではなく、ゴミデータで満たされた200 OKである。ソフトブロック、ハニーポット、汚染されたデータを検出する方法