提取明确字段
为名称、标题或其他值定义 CSS 选择器。为每个字段命名,让后续代码无需依赖整个页面的标记结构。
01 / 产品介绍
AdsCrawl 网页采集 API 通过 POST /spa-extract 从浏览器渲染的网站中提取指定字段。字段可使用 DOM 选择器或受支持的网络响应来源。需要渲染标记或可读正文时,则使用 POST /html 并选择对应输出模式。
02 / 适用场景
为名称、标题或其他值定义 CSS 选择器。为每个字段命名,让后续代码无需依赖整个页面的标记结构。
页面加载过程中获取 JSON 时,可以使用受支持的网络字段。匹配和提取规则以接口文档为准。
同时检查返回值与 missingFields,在数据进入监控或研究流程前发现选择器变化与加载不完整的问题。
03 / 快速开始
示例环境:Bash 与 cURL。 先在服务端设置 ADSCRAWL_API_KEY 环境变量。
完整参数与响应说明 →curl --fail-with-body -sS \
-X POST "https://api.adscrawl.net/spa-extract" \
-H "x-api-key: $ADSCRAWL_API_KEY" \
-H "content-type: application/json" \
-d '{
"url": "https://www.adscrawl.net",
"mode": "extract",
"fields": {
"title": {
"source": "dom",
"selector": "h1",
"parse": "string"
}
}
}'API Key 仅保存在服务端。遇到 HTTP 402 请检查额度,遇到 429 请降低并发并退避重试。
05 / FAQ
需要渲染 HTML 或可读正文时使用 /html;需要指定 DOM 或受支持的网络字段时使用 /spa-extract。
检查 missingFields 和返回数据,核实当前选择器与等待设置。目标网站结构改变后需要更新字段定义。
不代表。入库前需要检查必要字段、类型和业务规则,页面渲染与提取不会验证原文事实。