批量提取网页正文
批量提取网页正文 用于从已知 URL 中提取正文文本。它是桌面端本地内置能力,出现在「常用智能能力 / 网页采集」中,适合把搜索结果、文章页、公告页转成后续 AI 可处理的文本。
先选使用方式
Section titled “先选使用方式”| 方式 | 怎么用 | 适合人群 |
|---|---|---|
| 可视化编排(推荐) | 拖入 批量提取网页正文,填写一个或多个 URL | 需要快速读取网页正文的用户 |
| 代码编排(执行指令 XML) | 通过 TavilyExtract 动态传入 URL 列表 | 需要批量抽取网页内容的用户 |
什么时候用?
Section titled “什么时候用?”- 已经有一批 URL,需要提取正文。
- 搜索后想继续读取来源页面全文。
- 把网页内容交给大模型总结、分类或抽取字段。
urls必填,多个 URL 可用英文逗号、空格或换行分隔。- 适合正文提取;如果需要 Markdown、HTML 或截图,优先用「抓取单页内容」。
- 页面需要当前环境可访问。
| 界面名称 | 代码属性名 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|---|
| 网页 URL | urls | String | 是 | - | 一个或多个网页地址,用逗号、空格或换行分隔。 |
| 输出结果 | outKey | Output | 是 | 当前节点 | 保存提取结果对象。 |
| 字段 | 类型 | 说明 |
|---|---|---|
results | Array | 成功提取的页面数组,包含 url 和 content。 |
failed | Array | 提取失败的 URL 列表。 |
- 节点运行成功。
results中包含至少一个页面正文。failed为空,或失败 URL 已按需进入重试/告警流程。
| 报错 / 现象 | 可能原因 | 处理建议 |
|---|---|---|
TavilyExtract requires "urls" | 未填写 URL | 填写至少一个完整 URL。 |
TavilyExtract: urls 为空 | 分隔后没有有效 URL | 检查是否包含空格、换行或非法字符。 |
failed 不为空 | 部分页面不可访问或提取失败 | 检查 URL 可访问性,必要时改用单页抓取。 |
<TavilyExtract urls="https://example.com/a,https://example.com/b" outKey="extractResult"/>