Skip to content
登录 注册

提取规则

将经过 URL 编码的 JSON 传递给 extract_rules,以从目标页面获取结构化输出。每条规则包含一个 CSS 选择器、一个可选的输出类型,以及一个是否返回所有匹配项的标志。无论是否启用 JavaScript 渲染,提取规则均可正常工作。

GET https://scrape.shifter.io/v1?api_key=YOUR_API_KEY&url=<TARGET_URL>&extract_rules=<URL_ENCODED_JSON>
ParameterTypeRequiredDescription
api_keystringyes您的 Web Scraping API 密钥
urlstringyes要抓取的目标 URL
extract_rulesstringyes描述提取规则的 URL 编码 JSON。
FieldTypeRequiredDescription
selectorstringyesCSS 选择器。
outputstringnohtml(默认)、text,或用于提取属性的 @attr
allstringno"1" 表示以数组形式返回所有匹配项,"0"(默认)表示仅返回第一个匹配项。

将页面标题以文本形式提取:

{"title": {"selector": "h1", "output": "text"}}
Terminal window
curl "https://scrape.shifter.io/v1?api_key=YOUR_API_KEY&url=https%3A%2F%2Fexample.com&extract_rules=%7B%22title%22%3A%20%7B%22selector%22%3A%20%22h1%22%2C%20%22output%22%3A%20%22text%22%7D%7D"
{ "title": "Example Domain" }