跳转到主要内容

网页采集 API

网页采集 API,直接获取应用需要的字段。

在浏览器中渲染 JavaScript 页面,提取明确的一组字段,让后续流程接收结构化结果。

01 / 产品介绍

什么是网页采集 API?

AdsCrawl 网页采集 API 通过 POST /spa-extract 从浏览器渲染的网站中提取指定字段。字段可使用 DOM 选择器或受支持的网络响应来源。需要渲染标记或可读正文时,则使用 POST /html 并选择对应输出模式。

02 / 适用场景

适合哪些任务?

01

提取明确字段

为名称、标题或其他值定义 CSS 选择器。为每个字段命名,让后续代码无需依赖整个页面的标记结构。

02

读取动态数据

页面加载过程中获取 JSON 时,可以使用受支持的网络字段。匹配和提取规则以接口文档为准。

03

检查结果完整性

同时检查返回值与 missingFields,在数据进入监控或研究流程前发现选择器变化与加载不完整的问题。

03 / 快速开始

从一个完整流程开始

  1. 创建 API Key 并保存在服务端环境变量中。
  2. 检查目标页面,为每个必要字段确定选择器。
  3. 调用 POST /spa-extract,将 mode 设置为 extract 并提供 fields。
  4. 检查返回值与 missingFields,再使用结果。

示例环境:Bash 与 cURL。 先在服务端设置 ADSCRAWL_API_KEY 环境变量。

完整参数与响应说明 →
cURL
curl --fail-with-body -sS \
  -X POST "https://api.adscrawl.net/spa-extract" \
  -H "x-api-key: $ADSCRAWL_API_KEY" \
  -H "content-type: application/json" \
  -d '{
    "url": "https://www.adscrawl.net",
    "mode": "extract",
    "fields": {
      "title": {
        "source": "dom",
        "selector": "h1",
        "parse": "string"
      }
    }
  }'

04 / 限制与计费

接入前需要了解

比较套餐与额度 →
  • 目标网站改版可能导致选择器失效,不能假设每次请求都能返回所有字段。
  • 页面就绪时机取决于目标网站,请在接口支持范围内设置等待条件。
  • 多步导航、点击和表单操作应使用 Remote CDP,字段提取不能替代浏览器脚本。
  • 请求消耗账号额度并受并发限制,批量调度前请确认套餐。

API Key 仅保存在服务端。遇到 HTTP 402 请检查额度,遇到 429 请降低并发并退避重试。

05 / FAQ

常见问题

应该使用 /html 还是 /spa-extract?

需要渲染 HTML 或可读正文时使用 /html;需要指定 DOM 或受支持的网络字段时使用 /spa-extract。

选择器未匹配时怎么办?

检查 missingFields 和返回数据,核实当前选择器与等待设置。目标网站结构改变后需要更新字段定义。

请求成功就代表数据正确吗?

不代表。入库前需要检查必要字段、类型和业务规则,页面渲染与提取不会验证原文事实。