产品文档

高级 ASR 模型

Pro 套餐在「设置 → 模型 → ML 引擎」中的离线语音识别模型:适用语言、场景,以及与 Whisper、实时模型的取舍。

高级 ASR 模型

设置

转录设置总览截图

真实截图

这页解决什么问题

高级 ASR 模型Pro 专属、在「选择转录模型」里 ML 引擎 分类下的离线文件路线(例如 Qwen3-ASR、Cohere、Parakeet)。它们与 Whisper实时模型 并列可选,但主要面向离线文件转录,而不是麦克风低延迟场景。

本页说明各模型适合什么。

使用前要知道

  • 模式:当前能力以离线文件转录为主(整段/分段处理),不是实时模型那种麦克风低延迟路线。
  • 套餐:Free / Standard 无法选用;Pro(含终身)可使用应用内 ML 引擎分类列出的全部高级 ASR 模型。
  • 下载:首次使用需在设置中下载对应模型;体积通常大于 Tiny/Base Whisper。

模型一览

模型适合场景语言侧重说明
Qwen3-ASR会议、课程、中文混合内容中文、英文、日语、韩语及多种欧洲语言等多语识别,带标点,适合中文用户高质量离线稿
Cohere Transcribe(多语)国际化素材、访谈十余种常用语言偏高质量多语离线转录
Parakeet英语/欧洲语言、资源适中英语及多种欧洲语言体积相对紧凑,适合英语为主的批量素材

具体语言列表以应用内模型详情为准;更新模型后请以「设置 → 模型」展示为准。

和 Whisper、实时模型怎么选

需求更倾向
实时会议字幕、低延迟实时模型(或高性能 GPU + Whisper 实时)
社区 GGML、成熟档位、链接/监控工作流Whisper
Pro 用户、离线文件、特定多语高质量高级 ASR 模型(ML 引擎分类)

更多背景见 模型与引擎总览概念

高级参数

高级 ASR 场景在参数面板中有独立字段(与 Whisper VAD 不是同一套表)。调参请阅读 分引擎参数说明

常见问题

需要联网吗?
转录过程在本地完成;下载模型与授权验证可能联网。

能和 GPU Whisper 同时开吗?
它们是不同模型路线;一次任务选一种主模型。GPU 设置主要作用于 Whisper。

Standard 升级 Pro 后旧任务会变吗?
已完成的转录不变;新任务可在模型列表的 ML 引擎分类里选择高级 ASR 模型。

下一步阅读

Whisper大模型驱动 - 音视频秒转文字,声波流式转录,让每个声音都成篇章

Contact us

Email
Copyright © 2026. Made by AudioNote, All rights reserved.