跳转到主要内容

网页转 Markdown API

网页转 Markdown API,将可读正文接入您的工作流。

获取文本流程所需的文章内容。渲染页面、请求 Markdown,并为后续处理保留来源。

01 / 产品介绍

什么是网页转 Markdown API?

AdsCrawl 网页转 Markdown API 使用 POST /html,并将 contentMode 设置为 markdown,从浏览器渲染的页面中提取可读内容。它为研究、文档处理和大模型流程提供文本表示,适用于需要正文而非完整页面标记的任务。

02 / 适用场景

适合哪些任务?

01

准备检索文本

将可读正文输入自己的分块与检索流程,同时保存来源 URL,让后续答案能够引用原页面。

02

收集研究材料

以便于处理的文本格式保存文章内容,用于内部参考;在生成摘要或报告前检查结果。

03

选择合适的表示

正文选择 Markdown,渲染标记选择 HTML,精确值选择命名字段提取,减少不必要的格式解析。

03 / 快速开始

从一个完整流程开始

  1. 创建服务端 API Key,并选择页面 URL。
  2. 调用 POST /html,将 contentMode 设置为 markdown。
  3. 检查响应状态,将文本保存为 page.md。
  4. 检查提取内容,并在后续流程中保留来源 URL。

示例环境:Bash 与 cURL。 先在服务端设置 ADSCRAWL_API_KEY 环境变量。

完整参数与响应说明 →
cURL
curl --fail-with-body -sS \
  -X POST "https://api.adscrawl.net/html" \
  -H "x-api-key: $ADSCRAWL_API_KEY" \
  -H "content-type: application/json" \
  -d '{
    "url": "https://www.adscrawl.net",
    "contentMode": "markdown",
    "waitUntil": "domcontentloaded"
  }' \
  --output page.md

04 / 限制与计费

接入前需要了解

比较套餐与额度 →
  • 正文提取不是网页的无损副本,导航、交互组件和依赖布局的元素可能被省略。
  • Markdown 转换不会验证原文事实,也不代表获得转载许可。
  • 动态内容仍依赖页面加载与受支持的等待设置,需检查输出是否包含所需部分。
  • 请求消耗额度并受账号限制,该接口不会直接提供完整的检索或向量化流程。

API Key 仅保存在服务端。遇到 HTTP 402 请检查额度,遇到 429 请降低并发并退避重试。

05 / FAQ

常见问题

需要调用独立的 /markdown 接口吗?

不需要,调用 POST /html 并设置 contentMode 为 markdown,通过现有接口的输出模式获得 Markdown。

Markdown 包含所有页面元素吗?

不包含。它面向可读内容,不会完整表示视觉布局或所有交互元素。

提取精确商品字段适合用它吗?

需要固定命名值时,应使用网页采集 API 并显式定义字段;需要可读文本时再选择 Markdown。