コンテンツにスキップ
ログイン サインアップ

抽出ルール

URLエンコードされたJSONをextract_rulesに渡すことで、対象ページから構造化された出力を取得できます。各ルールにはCSSセレクタ、任意の出力タイプ、すべての一致を返すかどうかのフラグがあります。抽出ルールはJavaScriptレンダリングの有無にかかわらず動作します。

GET https://scrape.shifter.io/v1?api_key=YOUR_API_KEY&url=<TARGET_URL>&extract_rules=<URL_ENCODED_JSON>
ParameterTypeRequiredDescription
api_keystringyesあなたのWeb Scraping APIキー
urlstringyes取得対象のURL
extract_rulesstringyes抽出ルールを記述したURLエンコード済みJSON。
FieldTypeRequiredDescription
selectorstringyesCSSセレクタ。
outputstringnohtml(デフォルト)、text、または属性を取得するための@attr
allstringnoすべての一致を配列として返す場合は"1"、最初の一致のみの場合は"0"(デフォルト)。

ページタイトルをテキストとして抽出する:

{"title": {"selector": "h1", "output": "text"}}
Terminal window
curl "https://scrape.shifter.io/v1?api_key=YOUR_API_KEY&url=https%3A%2F%2Fexample.com&extract_rules=%7B%22title%22%3A%20%7B%22selector%22%3A%20%22h1%22%2C%20%22output%22%3A%20%22text%22%7D%7D"
{ "title": "Example Domain" }