获取网页信息
获取网页信息 用于读取当前网页的基本信息。可按需选择获取网址、标题、整页 HTML 或整页文本,并保存到变量供后续使用。
指令标识:GetPageInfo
指令类型:网页指令
指令描述:获取当前网页信息(网址 / 标题 / HTML / 文本)
先选使用方式
Section titled “先选使用方式”工作流支持「可视化编排」和「代码编排」两种创建方式。获取网页信息 在两种方式里都能用,核心业务参数一致,区别主要是你通过界面配置,还是通过 Python 脚本配置。
| 方式 | 怎么用 | 适合人群 |
|---|---|---|
| 可视化编排(推荐先学) | 拖入「获取网页信息」节点,选择要取的信息类型、设置输出变量 | 大多数用户,零代码,适合快速搭建和调试 |
| 代码编排(Python) | 在脚本中调用 bots.getPageInfo(operation="title", outKey="title") | 熟悉代码、需要复用脚本或批量生成流程的用户 |
第一次使用建议先用可视化编排跑通,再迁移到 Python 代码编排。下方「参数说明」同时给出界面字段和代码参数名,方便两种方式对应。
什么时候用?
Section titled “什么时候用?”- 需要记录当前页面的网址或标题,用于判断或输出。
- 需要拿整页 HTML 做后续解析。
- 需要拿整页可见文本做关键词检查。
如果只想要当前网址,也可以使用更专一的 获取当前网页URL。
- 当前已经有打开的页面,并加载到目标状态。
- 已经规划好输出变量名。
- 想清楚要取哪类信息:网址、标题、HTML 还是文本。
可视化编排:从 0 到跑通
Section titled “可视化编排:从 0 到跑通”下面用一个常见场景演示:记录当前页面标题。
- 确认页面已经打开并加载完成。
- 添加 获取网页信息 节点。
- 在 信息类型 选择标题(
title)。 - 在 将结果保存至 填写变量名,例如
pageTitle。 - 运行后查看变量值是否与页面标题一致。
| 界面名称 | 代码属性名 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|---|
| 信息类型 | operation | Enum | 是 | - | 指定要获取的信息类型,可选 url(获取网址)、title(获取网页标题)、html(获取网页源代码)、text(获取网址文本内容)。 |
| 界面名称 | 代码属性名 | 类型 | 必填 | 说明 |
|---|---|---|---|---|
| 将结果保存至 | outKey | String | 是 | 保存读取到的信息。url 返回网址,title 返回标题,html 返回整页 HTML,text 返回页面正文文本。 |
获取网页信息节点运行结束后状态为成功。- 运行日志中没有参数缺失、超时或执行失败等错误。
- 如果配置了输出变量,后续节点能够读取到符合预期的结果。
- 后续节点能够继续执行,流程没有因为该节点异常中断。
| 现象 / 报错原文 | 可能原因 | 处理建议 |
|---|---|---|
日志报 GetPageInfo requires "outKey" | 没有配置输出变量 | 配置「将结果保存至」 |
日志报 unsupported operation | 信息类型填了不支持的值 | 信息类型只能填 url、title、html、text 之一 |
| 取到的 HTML / 文本不完整 | 页面还没渲染完成 | 先用等待节点确认目标内容已渲染再获取 |
Python 代码编排
Section titled “Python 代码编排”代码编排以 Python 为主。运行上下文由代码编排模板创建,示例里只需要关注业务指令本身。
# 获取页面标题title = bots.getPageInfo(operation="title", outKey="pageTitle")print(title)获取整页文本用于关键词检查:
text = bots.getPageInfo(operation="text", outKey="pageText")获取整页 HTML 用于后续解析:
html = bots.getPageInfo(operation="html", outKey="pageHtml")如果你想在工作流中通过节点动态编排指令,可使用 执行指令(XML)节点。
Q1:信息类型如何选择?
Section titled “Q1:信息类型如何选择?”A: 信息类型为必填项,按需选择其中一种:url(网址)、title(标题)、html(整页 HTML 源码)、text(页面正文文本)。
Q2:html 和 text 有什么区别?
Section titled “Q2:html 和 text 有什么区别?”A: html 返回整页 HTML 源码(含标签);text 返回页面正文的可见文本(不含标签)。需要做解析用 html,做关键词检查用 text 更方便。