ブログ

ガイド、チュートリアル& インサイト

Shifterチームが提供するレジデンシャルプロキシ、ウェブスクレイピング、データ収集戦略、業界のベストプラクティスについて学ぶ。

ナレッジ
ナレッジ 2 分で読める

ロケール間での価格、数値、日付の正規化

1.234,56 €と$1,234.56はどちらも価格であり、03/04/2026は2つの異なる日付を表します。ロケールごとにスクレイピングした値を正しく解析する方法を、テスト済みのコードとともに解説します。

James Meadow James Meadow · 2026年9月30日
スクレイピング
スクレイピング 2 分で読める

ページの裏にあるAPIを見つける: HTMLではなくJSONエンドポイントから収集する

多くのページはデータをJSONとして読み込みます。それを運ぶエンドポイントの見つけ方、それがページのセッションに紐づいていることが多い理由、そして責任を持って収集する方法について。

Chris Collins Chris Collins · 2026年9月30日
ニュース
ニュース 1 分で読める

IP Infoのご紹介:APIキー不要の無料IPジオロケーションAPI

IP Infoは、Shifterが提供する無料のIPジオロケーション・ASN APIです。当社のプロキシプールを支える同じデータベース上で動作し、サインアップやAPIキーは不要で、AIエージェントにも対応しています。

James Meadow James Meadow · 2026年9月29日
ナレッジ
ナレッジ 3 分で読める

スクレイピングデータのスキーマドリフト:ユーザーより先に壊れた抽出処理を検知する

サイトが変更されても、スクレイパーはめったにクラッシュしません。動き続けたまま、微妙に間違ったデータを返し続けます。データコントラクトとバッチプロファイリングがどのようにドリフトを早期に検知するかを解説します。

Matt Brown Matt Brown · 2026年9月29日
スクレイピング
スクレイピング 3 分で読める

発見ソースとしてのサイトマップ:サイト全体をクロールせずにすべてのURLを見つける方法

XMLサイトマップはサイトのURL一覧を示し、変更日時が含まれることもあります。それを正しく読み取る方法と、lastmodを確認せずに信用してはいけない理由。

James Meadow James Meadow · 2026年9月29日
スクレイピング
スクレイピング 3 分で読める

LLM抽出 vs セレクター: モデルにページを読ませるべき時

大規模言語モデルに18の実際のニュースページからフィールドを抽出させ、各ページ自身の構造化データと照合してスコアを算出しました。精度、コスト、そして使うべき場面について。

Chris Collins Chris Collins · 2026年9月28日
ナレッジ
ナレッジ 3 分で読める

スクレイピングデータの重複排除:製品・企業・掲載情報のためのエンティティ解決

同じ製品、企業、掲載情報が複数のソースや実行にまたがって何度も現れる。識別子を正規化し、大規模に安全にマッチングを行い、1つのクリーンなレコードを維持する方法。

Matt Brown Matt Brown · 2026年9月28日
ナレッジ
ナレッジ 2 分で読める

クリーンレコード当たりのコスト:財務部門が実際に理解できるスクレイピング指標

ギガバイト数やリクエスト数は、データにかかるコストを財務部門に伝えるものではありません。クリーンレコード当たり、そして有用な変更当たりのコストをどう測定するか、そしてどのレバーが最も大きく影響するか。

James Meadow James Meadow · 2026年9月27日