爬取整站内容
爬取整站内容 用于从一个入口页开始发现并抓取站点内页面,输出页面列表、总数和任务 ID。它是桌面端本地内置能力,出现在「常用智能能力 / 网页采集」中,适合采集官网、帮助中心、文档站或专题页面。
先选使用方式
Section titled “先选使用方式”| 方式 | 怎么用 | 适合人群 |
|---|---|---|
| 可视化编排(推荐) | 拖入 爬取整站内容,填写入口地址和最大页数 | 需要批量采集站点内容的用户 |
| 代码编排(执行指令 XML) | 通过 FirecrawlCrawl 动态传入入口和抓取范围 | 需要自动化巡检或批量抓取的用户 |
什么时候用?
Section titled “什么时候用?”- 批量采集帮助中心、文档站或官网内容。
- 为知识库构建、内容分析、竞品研究准备页面正文。
- 需要从一个入口页发现并抓取多个站内链接。
url必填,建议从列表页、文档首页或目录页开始。maxPages建议先用 10~20 验证,再逐步调大。- 排除登录页、后台页、搜索页等低价值路径,可减少噪声。
| 界面名称 | 代码属性名 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|---|
| 入口地址 | url | String | 是 | - | 爬取开始页面。 |
| 最大页数 | maxPages | Number | 否 | 20 | 限制最多抓取多少页。 |
| 排除路径 | exclude | String | 否 | - | 多个路径用英文逗号或换行分隔,如 /login,/admin。 |
| 只启动任务 | noWait | Boolean | 否 | false | 开启后立即返回 jobId,不等待完成。 |
| 输出结果 | outKey | Output | 是 | 当前节点 | 保存爬取结果对象。 |
| 字段 | 类型 | 说明 |
|---|---|---|
pages | Array | 等待完成时返回的页面数组,包含 url 和 markdown。 |
total | Number | 实际爬取到的页面数量。 |
jobId | String | 爬取任务 ID;只启动任务时用于后续查询。 |
- 节点运行成功并返回
jobId。 - 等待完成时,
pages中包含目标站点页面。 total与预期抓取范围基本一致。
| 报错 / 现象 | 可能原因 | 处理建议 |
|---|---|---|
FirecrawlCrawl requires "url" | 未填写入口地址 | 填写站点入口 URL。 |
启动失败 | 站点不可访问或服务拒绝 | 检查入口 URL 和访问权限。 |
未获取到 jobId | 爬取任务未正常创建 | 降低最大页数后重试。 |
| 抓取太慢 | 页面多或站点响应慢 | 减小 maxPages,或开启 noWait 只启动任务。 |
<FirecrawlCrawl url="https://example.com/docs" maxPages="20" exclude="/login,/admin,/search" outKey="crawlResult"/>