准备检索文本
将可读正文输入自己的分块与检索流程,同时保存来源 URL,让后续答案能够引用原页面。
01 / 产品介绍
AdsCrawl 网页转 Markdown API 使用 POST /html,并将 contentMode 设置为 markdown,从浏览器渲染的页面中提取可读内容。它为研究、文档处理和大模型流程提供文本表示,适用于需要正文而非完整页面标记的任务。
02 / 适用场景
将可读正文输入自己的分块与检索流程,同时保存来源 URL,让后续答案能够引用原页面。
以便于处理的文本格式保存文章内容,用于内部参考;在生成摘要或报告前检查结果。
正文选择 Markdown,渲染标记选择 HTML,精确值选择命名字段提取,减少不必要的格式解析。
03 / 快速开始
示例环境:Bash 与 cURL。 先在服务端设置 ADSCRAWL_API_KEY 环境变量。
完整参数与响应说明 →curl --fail-with-body -sS \
-X POST "https://api.adscrawl.net/html" \
-H "x-api-key: $ADSCRAWL_API_KEY" \
-H "content-type: application/json" \
-d '{
"url": "https://www.adscrawl.net",
"contentMode": "markdown",
"waitUntil": "domcontentloaded"
}' \
--output page.mdAPI Key 仅保存在服务端。遇到 HTTP 402 请检查额度,遇到 429 请降低并发并退避重试。
05 / FAQ
不需要,调用 POST /html 并设置 contentMode 为 markdown,通过现有接口的输出模式获得 Markdown。
不包含。它面向可读内容,不会完整表示视觉布局或所有交互元素。
需要固定命名值时,应使用网页采集 API 并显式定义字段;需要可读文本时再选择 Markdown。