语音转写(ASR)
语音转写(ASR) 用于把音频或视频文件识别为文字。它是桌面端本地内置 AI 能力,出现在「常用智能能力 / 语音识别」中,适合会议录音整理、视频字幕生成、语音资料归档等场景。
先选使用方式
Section titled “先选使用方式”| 方式 | 怎么用 | 适合人群 |
|---|---|---|
| 可视化编排(推荐) | 拖入 语音转写(ASR),选择音频/视频文件并运行 | 需要快速得到文本或字幕的用户 |
| 代码编排(执行指令 XML) | 通过 ASRTranscribe 动态传入文件路径 | 需要批量转写的用户 |
什么时候用?
Section titled “什么时候用?”- 把会议录音、访谈音频转成文字。
- 给视频生成 SRT 字幕。
- 批量处理本地音频文件,并把文本交给后续大模型总结。
input必须是本地可读取的音频或视频文件。- 支持常见格式:
.mp3、.wav、.m4a、.flac、.mp4、.mov等。 - 文件越长,转写耗时越久。
| 界面名称 | 代码属性名 | 类型 | 必填 | 默认值 | 说明 |
|---|---|---|---|---|---|
| 音频/视频文件 | input | File | 是 | - | 本地音频或视频文件路径。 |
| 模型 | model | String | 否 | whisper-1 | 语音识别模型。 |
| 输出格式 | format | Enum | 否 | text | text 输出纯文本,srt 输出字幕。 |
| 语言 | language | String | 否 | 自动识别 | ISO 语言码,例如 zh、en、ja。 |
| 输出目录 | outputDir | Directory | 否 | 默认输出目录 | 保存转写结果文件。 |
| 将结果保存至 | outKey | Output | 是 | 当前节点 | 保存转写结果对象。 |
| 字段 | 类型 | 说明 |
|---|---|---|
text | String | 识别出的文字内容。 |
file | String | 转写结果保存到的本地文件路径。 |
inputFile | String | 输入文件路径。 |
format | String | 输出格式。 |
model | String | 实际使用模型。 |
- 节点运行成功。
- 输出变量包含
text。 - 本地输出目录中生成
.txt或.srt文件。
| 报错 / 现象 | 可能原因 | 处理建议 |
|---|---|---|
ASRTranscribe requires "input" | 未选择文件 | 选择本地音频或视频文件。 |
ASRTranscribe 失败 | 文件无法读取或服务异常 | 检查文件路径、格式和网络服务。 |
| 文本为空或乱码 | 音频质量差或语言识别不准 | 指定 language,或换更清晰的音频。 |
| 字幕时间轴不理想 | 模型返回的字幕信息不稳定 | 改用纯文本输出,或用字幕工具二次校正。 |
<ASRTranscribe input="/Users/example/audio.mp3" format="text" language="zh" outKey="asrResult"/>