产品文档
分引擎转录参数说明
按 Whisper 文件、Whisper 实时、实时模型与高级 ASR 梳理可调参数、场景预设与 Standard/Pro 差异。
分引擎转录参数说明
高级参数
高级转录参数截图
这页解决什么问题
「高级参数」在 Whisper 文件、Whisper 实时、实时模型 与 高级 ASR(ML 引擎分类) 下不是同一套表单。混用说明会导致「文档写了但界面没有」的困惑。
本页是 SEO 枢纽;概念与调参节奏请先读 高级参数转录。
套餐与可调范围(摘要)
| 能力 | Free | Standard | Pro |
|---|---|---|---|
| 高级转录参数(文件等) | 否 | 是 | 是 |
| 实时参数 预设 | — | 是 | 是 |
| 实时参数 自定义 | — | 否 | 是 |
| 高级 ASR 模型 | — | — | 是 |
Whisper 文件转录
何时出现:文件、链接、监控文件夹等离线批量路线,模型为 Whisper 时。
常见参数类别(界面以 Standard+ 高级开关为准):
| 类别 | 典型用途 |
|---|---|
| 场景预设 | 一键调整 VAD、断句、解码倾向(见下表) |
| VAD / 无语音阈值 | 减少静音幻觉、控制切段 |
| 解码策略 | Greedy / Beam、best-of、上下文长度 |
| 片段与偏移 | 只转某一段、限制长度 |
| 并行与说话人 | Pro:说话人分离、人声分离等(独立功能开关) |
Whisper 文件场景预设(用户意图)
| 预设 | 更适合 | 主要调整方向 |
|---|---|---|
| 通用 | 多数素材 | 均衡 VAD 与解码 |
| 对话 | 访谈、双人对话 | 较短语音段、略积极断句 |
| 演讲 | 单人长段讲述 | 较长段、更大上下文 |
| 会议 | 多人、较长静音 | 会议向 VAD 与段长 |
| 课程 | 讲课、幻灯片讲解 | 更长段与上下文 |
| 嘈杂 | 环境噪声大 | 更强 VAD/降噪倾向、Beam 解码 |
| 影视/媒体 | 背景音乐、对白混杂 | 保守无语音判定、轻降噪 |
| 自定义 | 固定团队模板 | 在预设基础上手动保存 |
选择「自定义」后改动会写入个人配置;与 Standard/Pro 无关,但与是否开启「高级」相关。
Whisper 实时转录
何时出现:麦克风、应用或全局实时,且选用 Whisper 作为实时引擎时。
与文件转录不共用同一参数表。常见项包括:
- 实时步长/窗长(影响延迟与稳定性)
- 分段模式(何时切句显示)
- Silero / 能量 VAD 相关阈值
- 线程数
调参时优先保证 RTF 可接受,再追求字面准确率。GPU 可改善 Whisper 实时,但不是所有机器都需要。
实时模型
何时出现:实时场景下在模型列表选择「实时模型」时(如 Zipformer 系列)。
重点在 语音活动检测与切段,而非 Whisper 的 Beam 解码:
- VAD 场景预设
- 最小语音/静音时长
- 最小/最大分段时长
- 前后补偿、合并间隔
- 线程数
请勿把 Whisper 文件的「无语音阈值 / Beam」说明套用到实时模型。
高级 ASR(ML 引擎分类)
何时出现:Pro 用户、文件转录、在 ML 引擎 分类选择高级 ASR 模型时。
- 能力与语言因模型而异(见 高级 ASR 模型)。
- 高级项在独立表单中配置(如分段长度、语言约束等),不要与 Whisper VAD 表合并理解。
- 当前以离线文件为主;实时模型参数不适用。
维护说明(给读者)
应用更新可能增减高级项。若界面与本文不一致,以应用内显示为准,并可在官网反馈。
常见问题
Standard 能改实时参数吗?
可以改预设;自定义实时参数需 Pro。
文件预设会影响链接转录吗?
同一 Whisper 文件参数体系会作用于支持的离线批量入口。
哪里看 GPU?
GPU 属于引擎/运行方式,不是本表字段;见 GPU 转录。