跳转到内容

语音转写(ASR)

语音转写(ASR) 用于把音频或视频文件识别为文字。它是桌面端本地内置 AI 能力,出现在「常用智能能力 / 语音识别」中,适合会议录音整理、视频字幕生成、语音资料归档等场景。

方式怎么用适合人群
可视化编排(推荐)拖入 语音转写(ASR),选择音频/视频文件并运行需要快速得到文本或字幕的用户
代码编排(执行指令 XML)通过 ASRTranscribe 动态传入文件路径需要批量转写的用户
  • 把会议录音、访谈音频转成文字。
  • 给视频生成 SRT 字幕。
  • 批量处理本地音频文件,并把文本交给后续大模型总结。
  • input 必须是本地可读取的音频或视频文件。
  • 支持常见格式:.mp3.wav.m4a.flac.mp4.mov 等。
  • 文件越长,转写耗时越久。
语音转写(ASR)
界面名称代码属性名类型必填默认值说明
音频/视频文件inputFile-本地音频或视频文件路径。
模型modelStringwhisper-1语音识别模型。
输出格式formatEnumtexttext 输出纯文本,srt 输出字幕。
语言languageString自动识别ISO 语言码,例如 zhenja
输出目录outputDirDirectory默认输出目录保存转写结果文件。
将结果保存至outKeyOutput当前节点保存转写结果对象。
字段类型说明
textString识别出的文字内容。
fileString转写结果保存到的本地文件路径。
inputFileString输入文件路径。
formatString输出格式。
modelString实际使用模型。
  • 节点运行成功。
  • 输出变量包含 text
  • 本地输出目录中生成 .txt.srt 文件。
报错 / 现象可能原因处理建议
ASRTranscribe requires "input"未选择文件选择本地音频或视频文件。
ASRTranscribe 失败文件无法读取或服务异常检查文件路径、格式和网络服务。
文本为空或乱码音频质量差或语言识别不准指定 language,或换更清晰的音频。
字幕时间轴不理想模型返回的字幕信息不稳定改用纯文本输出,或用字幕工具二次校正。
<ASRTranscribe
input="/Users/example/audio.mp3"
format="text"
language="zh"
outKey="asrResult"
/>