跳转到内容

批量提取网页正文

批量提取网页正文 用于从已知 URL 中提取正文文本。它是桌面端本地内置能力,出现在「常用智能能力 / 网页采集」中,适合把搜索结果、文章页、公告页转成后续 AI 可处理的文本。

方式怎么用适合人群
可视化编排(推荐)拖入 批量提取网页正文,填写一个或多个 URL需要快速读取网页正文的用户
代码编排(执行指令 XML)通过 TavilyExtract 动态传入 URL 列表需要批量抽取网页内容的用户
  • 已经有一批 URL,需要提取正文。
  • 搜索后想继续读取来源页面全文。
  • 把网页内容交给大模型总结、分类或抽取字段。
  • urls 必填,多个 URL 可用英文逗号、空格或换行分隔。
  • 适合正文提取;如果需要 Markdown、HTML 或截图,优先用「抓取单页内容」。
  • 页面需要当前环境可访问。
批量提取网页正文
界面名称代码属性名类型必填默认值说明
网页 URLurlsString-一个或多个网页地址,用逗号、空格或换行分隔。
输出结果outKeyOutput当前节点保存提取结果对象。
字段类型说明
resultsArray成功提取的页面数组,包含 urlcontent
failedArray提取失败的 URL 列表。
  • 节点运行成功。
  • results 中包含至少一个页面正文。
  • failed 为空,或失败 URL 已按需进入重试/告警流程。
报错 / 现象可能原因处理建议
TavilyExtract requires "urls"未填写 URL填写至少一个完整 URL。
TavilyExtract: urls 为空分隔后没有有效 URL检查是否包含空格、换行或非法字符。
failed 不为空部分页面不可访问或提取失败检查 URL 可访问性,必要时改用单页抓取。
<TavilyExtract
urls="https://example.com/a,https://example.com/b"
outKey="extractResult"
/>