抓取单页内容
抓取单页内容 用于抓取一个网页,并把正文转成 Markdown。它是桌面端本地内置能力,出现在「常用智能能力 / 网页采集」中,适合采集文章页、商品页、详情页和帮助文档页面。
先选使用方式
Section titled “先选使用方式”| 方式 | 怎么用 | 适合人群 |
|---|---|---|
| 可视化编排(推荐) | 拖入 抓取单页内容,填写网页地址并运行 | 需要稳定抓取单页正文的用户 |
| 代码编排(执行指令 XML) | 通过 FirecrawlScrape 动态传入 URL 和抓取选项 | 需要批量处理单页 URL 的用户 |
什么时候用?
Section titled “什么时候用?”- 抓取一篇文章、一条详情页或一个帮助文档页面。
- 需要 Markdown 正文交给后续大模型处理。
- 需要保留 HTML 或页面截图用于复核。
url必填,且当前执行环境可访问。- 默认只保留正文,减少导航、广告等噪声。
- 开启 HTML 或截图会增加输出体积。
| 界面名称 | 代码属性名 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|---|
| 网页地址 | url | String | 是 | - | 要抓取的单个网页 URL。 |
| 只保留正文 | onlyMainContent | Boolean | 否 | true | 过滤导航、页脚、广告等内容。 |
| 附带 HTML | html | Boolean | 否 | false | 返回页面 HTML。 |
| 附带截图 | screenshot | Boolean | 否 | false | 返回截图 URL 或 base64。 |
| 输出结果 | outKey | Output | 是 | 当前节点 | 保存抓取结果对象。 |
| 字段 | 类型 | 说明 |
|---|---|---|
markdown | String | 清洗后的 Markdown 正文。 |
url | String | 实际抓取的页面地址。 |
metadata | Object | 标题、描述、站点等页面元信息。 |
html | String | 开启「附带 HTML」后返回。 |
screenshot | String | 开启「附带截图」后返回。 |
- 节点运行成功。
- 输出变量包含非空
markdown。 metadata中能看到页面标题或来源信息。
| 报错 / 现象 | 可能原因 | 处理建议 |
|---|---|---|
FirecrawlScrape requires "url" | 未填写 URL | 填写完整网页地址。 |
提取失败 | 页面不可访问、被拦截或无正文 | 在浏览器中打开 URL 验证,必要时关闭正文过滤。 |
| Markdown 为空 | 页面需要登录或动态加载 | 确认执行环境有访问权限,或换用可公开访问页面。 |
<FirecrawlScrape url="https://example.com/article/123" onlyMainContent="true" html="false" screenshot="false" outKey="pageResult"/>