跳转到内容

爬取整站内容

爬取整站内容 用于从一个入口页开始发现并抓取站点内页面,输出页面列表、总数和任务 ID。它是桌面端本地内置能力,出现在「常用智能能力 / 网页采集」中,适合采集官网、帮助中心、文档站或专题页面。

方式怎么用适合人群
可视化编排(推荐)拖入 爬取整站内容,填写入口地址和最大页数需要批量采集站点内容的用户
代码编排(执行指令 XML)通过 FirecrawlCrawl 动态传入入口和抓取范围需要自动化巡检或批量抓取的用户
  • 批量采集帮助中心、文档站或官网内容。
  • 为知识库构建、内容分析、竞品研究准备页面正文。
  • 需要从一个入口页发现并抓取多个站内链接。
  • url 必填,建议从列表页、文档首页或目录页开始。
  • maxPages 建议先用 10~20 验证,再逐步调大。
  • 排除登录页、后台页、搜索页等低价值路径,可减少噪声。
爬取整站内容
界面名称代码属性名类型必填默认值说明
入口地址urlString-爬取开始页面。
最大页数maxPagesNumber20限制最多抓取多少页。
排除路径excludeString-多个路径用英文逗号或换行分隔,如 /login,/admin
只启动任务noWaitBooleanfalse开启后立即返回 jobId,不等待完成。
输出结果outKeyOutput当前节点保存爬取结果对象。
字段类型说明
pagesArray等待完成时返回的页面数组,包含 urlmarkdown
totalNumber实际爬取到的页面数量。
jobIdString爬取任务 ID;只启动任务时用于后续查询。
  • 节点运行成功并返回 jobId
  • 等待完成时,pages 中包含目标站点页面。
  • total 与预期抓取范围基本一致。
报错 / 现象可能原因处理建议
FirecrawlCrawl requires "url"未填写入口地址填写站点入口 URL。
启动失败站点不可访问或服务拒绝检查入口 URL 和访问权限。
未获取到 jobId爬取任务未正常创建降低最大页数后重试。
抓取太慢页面多或站点响应慢减小 maxPages,或开启 noWait 只启动任务。
<FirecrawlCrawl
url="https://example.com/docs"
maxPages="20"
exclude="/login,/admin,/search"
outKey="crawlResult"
/>