产品文档
高级 ASR 模型
Pro 套餐在「设置 → 模型 → ML 引擎」中的离线语音识别模型:适用语言、场景,以及与 Whisper、实时模型的取舍。
高级 ASR 模型
设置
转录设置总览截图
这页解决什么问题
高级 ASR 模型是 Pro 专属、在「选择转录模型」里 ML 引擎 分类下的离线文件路线(例如 Qwen3-ASR、Cohere、Parakeet)。它们与 Whisper、实时模型 并列可选,但主要面向离线文件转录,而不是麦克风低延迟场景。
本页说明各模型适合什么。
使用前要知道
- 模式:当前能力以离线文件转录为主(整段/分段处理),不是实时模型那种麦克风低延迟路线。
- 套餐:Free / Standard 无法选用;Pro(含终身)可使用应用内 ML 引擎分类列出的全部高级 ASR 模型。
- 下载:首次使用需在设置中下载对应模型;体积通常大于 Tiny/Base Whisper。
模型一览
| 模型 | 适合场景 | 语言侧重 | 说明 |
|---|---|---|---|
| Qwen3-ASR | 会议、课程、中文混合内容 | 中文、英文、日语、韩语及多种欧洲语言等 | 多语识别,带标点,适合中文用户高质量离线稿 |
| Cohere Transcribe(多语) | 国际化素材、访谈 | 十余种常用语言 | 偏高质量多语离线转录 |
| Parakeet | 英语/欧洲语言、资源适中 | 英语及多种欧洲语言 | 体积相对紧凑,适合英语为主的批量素材 |
具体语言列表以应用内模型详情为准;更新模型后请以「设置 → 模型」展示为准。
和 Whisper、实时模型怎么选
| 需求 | 更倾向 |
|---|---|
| 实时会议字幕、低延迟 | 实时模型(或高性能 GPU + Whisper 实时) |
| 社区 GGML、成熟档位、链接/监控工作流 | Whisper |
| Pro 用户、离线文件、特定多语高质量 | 高级 ASR 模型(ML 引擎分类) |
高级参数
高级 ASR 场景在参数面板中有独立字段(与 Whisper VAD 不是同一套表)。调参请阅读 分引擎参数说明。
常见问题
需要联网吗?
转录过程在本地完成;下载模型与授权验证可能联网。
能和 GPU Whisper 同时开吗?
它们是不同模型路线;一次任务选一种主模型。GPU 设置主要作用于 Whisper。
Standard 升级 Pro 后旧任务会变吗?
已完成的转录不变;新任务可在模型列表的 ML 引擎分类里选择高级 ASR 模型。