跳转到内容

抓取单页内容

抓取单页内容 用于抓取一个网页,并把正文转成 Markdown。它是桌面端本地内置能力,出现在「常用智能能力 / 网页采集」中,适合采集文章页、商品页、详情页和帮助文档页面。

方式怎么用适合人群
可视化编排(推荐)拖入 抓取单页内容,填写网页地址并运行需要稳定抓取单页正文的用户
代码编排(执行指令 XML)通过 FirecrawlScrape 动态传入 URL 和抓取选项需要批量处理单页 URL 的用户
  • 抓取一篇文章、一条详情页或一个帮助文档页面。
  • 需要 Markdown 正文交给后续大模型处理。
  • 需要保留 HTML 或页面截图用于复核。
  • url 必填,且当前执行环境可访问。
  • 默认只保留正文,减少导航、广告等噪声。
  • 开启 HTML 或截图会增加输出体积。
抓取单页内容
界面名称代码属性名类型必填默认值说明
网页地址urlString-要抓取的单个网页 URL。
只保留正文onlyMainContentBooleantrue过滤导航、页脚、广告等内容。
附带 HTMLhtmlBooleanfalse返回页面 HTML。
附带截图screenshotBooleanfalse返回截图 URL 或 base64。
输出结果outKeyOutput当前节点保存抓取结果对象。
字段类型说明
markdownString清洗后的 Markdown 正文。
urlString实际抓取的页面地址。
metadataObject标题、描述、站点等页面元信息。
htmlString开启「附带 HTML」后返回。
screenshotString开启「附带截图」后返回。
  • 节点运行成功。
  • 输出变量包含非空 markdown
  • metadata 中能看到页面标题或来源信息。
报错 / 现象可能原因处理建议
FirecrawlScrape requires "url"未填写 URL填写完整网页地址。
提取失败页面不可访问、被拦截或无正文在浏览器中打开 URL 验证,必要时关闭正文过滤。
Markdown 为空页面需要登录或动态加载确认执行环境有访问权限,或换用可公开访问页面。
<FirecrawlScrape
url="https://example.com/article/123"
onlyMainContent="true"
html="false"
screenshot="false"
outKey="pageResult"
/>