跳转到内容

获取网页信息

获取网页信息 用于读取当前网页的基本信息。可按需选择获取网址、标题、整页 HTML 或整页文本,并保存到变量供后续使用。

指令标识:GetPageInfo
指令类型:网页指令
指令描述:获取当前网页信息(网址 / 标题 / HTML / 文本)

工作流支持「可视化编排」和「代码编排」两种创建方式。获取网页信息 在两种方式里都能用,核心业务参数一致,区别主要是你通过界面配置,还是通过 Python 脚本配置。

方式怎么用适合人群
可视化编排(推荐先学)拖入「获取网页信息」节点,选择要取的信息类型、设置输出变量大多数用户,零代码,适合快速搭建和调试
代码编排(Python)在脚本中调用 bots.getPageInfo(operation="title", outKey="title")熟悉代码、需要复用脚本或批量生成流程的用户

第一次使用建议先用可视化编排跑通,再迁移到 Python 代码编排。下方「参数说明」同时给出界面字段和代码参数名,方便两种方式对应。

  • 需要记录当前页面的网址或标题,用于判断或输出。
  • 需要拿整页 HTML 做后续解析。
  • 需要拿整页可见文本做关键词检查。

如果只想要当前网址,也可以使用更专一的 获取当前网页URL

  • 当前已经有打开的页面,并加载到目标状态。
  • 已经规划好输出变量名。
  • 想清楚要取哪类信息:网址、标题、HTML 还是文本。
获取网页信息

下面用一个常见场景演示:记录当前页面标题

  1. 确认页面已经打开并加载完成。
  2. 添加 获取网页信息 节点。
  3. 信息类型 选择标题(title)。
  4. 将结果保存至 填写变量名,例如 pageTitle
  5. 运行后查看变量值是否与页面标题一致。
界面名称代码属性名类型必填默认值说明
信息类型operationEnum-指定要获取的信息类型,可选 url(获取网址)、title(获取网页标题)、html(获取网页源代码)、text(获取网址文本内容)。
界面名称代码属性名类型必填说明
将结果保存至outKeyString保存读取到的信息。url 返回网址,title 返回标题,html 返回整页 HTML,text 返回页面正文文本。
  • 获取网页信息 节点运行结束后状态为成功。
  • 运行日志中没有参数缺失、超时或执行失败等错误。
  • 如果配置了输出变量,后续节点能够读取到符合预期的结果。
  • 后续节点能够继续执行,流程没有因为该节点异常中断。
现象 / 报错原文可能原因处理建议
日志报 GetPageInfo requires "outKey"没有配置输出变量配置「将结果保存至」
日志报 unsupported operation信息类型填了不支持的值信息类型只能填 urltitlehtmltext 之一
取到的 HTML / 文本不完整页面还没渲染完成先用等待节点确认目标内容已渲染再获取

代码编排以 Python 为主。运行上下文由代码编排模板创建,示例里只需要关注业务指令本身。

# 获取页面标题
title = bots.getPageInfo(operation="title", outKey="pageTitle")
print(title)

获取整页文本用于关键词检查:

text = bots.getPageInfo(operation="text", outKey="pageText")

获取整页 HTML 用于后续解析:

html = bots.getPageInfo(operation="html", outKey="pageHtml")

如果你想在工作流中通过节点动态编排指令,可使用 执行指令(XML)节点。

A: 信息类型为必填项,按需选择其中一种:url(网址)、title(标题)、html(整页 HTML 源码)、text(页面正文文本)。

A: html 返回整页 HTML 源码(含标签);text 返回页面正文的可见文本(不含标签)。需要做解析用 html,做关键词检查用 text 更方便。