跳到主要内容

云端听写选型总览

云端听写把音频交给在线 ASR 服务转写:免 GPU、免下载模型,填好 API Key 即可开始,速度与本机性能无关。低配电脑与批量任务的省心之选。

隐私提醒

转写时音频会上传到你配置的服务商端点(妙幕不经手中转),凭据仅保存在本地。首次运行有隐私确认;请勿用于敏感内容,并留意服务商的用量计费。

8 家服务商对比

服务商免费额度语种特点
OpenAI 兼容视端点而定多语种协议通用:OpenAI / Groq / 硅基流动或自建端点,可加多个实例
Groq(OpenAI 兼容预设)有免费档多语种whisper-large-v3 推理极快,免费档慷慨
硅基流动(OpenAI 兼容预设)有免费模型中文强SenseVoice 系模型,国内直连
ElevenLabs Scribe有免费档90+scribe_v2 模型,词级时间戳
Deepgram新用户赠额度30+nova-2 / nova-3,速度快
火山引擎豆包中文强录音文件识别·极速版,按时长计费
腾讯云每月赠 5 小时中英粤 + 多语种录音识别极速版,标准 / 大模型双档位
阿里云无(仅商用版)以项目配置为准录音识别极速版,语种在控制台项目设定
讯飞视活动而定中文方言强转写大模型,异步订单制、退出应用不丢任务
Gladia每月赠 10 小时100+solaria 模型,小语种覆盖广

按需求推荐

  • 零成本试用:腾讯云(月赠 5h)或 Gladia(月赠 10h,注意免费档音频会用于其模型训练)
  • 中文内容:腾讯云 / 火山豆包 / 讯飞;硅基流动的 SenseVoice 也很能打
  • 小语种 / 多语言:Gladia(100+ 语种)或 ElevenLabs Scribe
  • 已有 OpenAI / Groq Key:直接用 OpenAI 兼容预设,一分钟接入

配置入口与通用机制

「引擎」页面左栏「云端听写」分组:选中服务商 → 填凭据 → 「测试连接」验证 → 就绪。通用行为:

  • 多服务商多实例:可同时配置多家,逐任务选择
  • 词级时间戳优先:服务商返回词级时间戳时走内置成句管线(时间轴最准);缺失时按静音切片降级
  • 大文件自动处理:自动压缩 / 切片以符合各家上传限制
  • 全局限流:云端任务按服务商全局限流调度,并发数请求间隔 每家可调