跳到主要内容

faster-whisper

本地离线 · 数据不出本机
凭据
无需凭据
免费额度
完全免费
计费方式
本地运行,无费用
推荐场景
追求速度与精度的用户;NVIDIA 显卡可用 GPU 运行时

基于 CTranslate2 的 whisper 实现,同级模型下速度通常快于原版。运行时与模型都在应用内按需下载,无需自己折腾 Python 环境。

在妙幕中配置​

「引擎」页面选中「faster-whisper」:

  1. 安装运行时:首次使用点安装,应用会下载一个自包含运行时(独立于系统 Python)
  2. 选择计算设备:CPU 或 GPU(NVIDIA CUDA)。两种运行时可以共存——切换不再重复下载,旧运行时本地驻留,切回秒级完成、可离线;卸载引擎时一并清理
  3. 下载模型:模型按需从 HuggingFace / 镜像源下载(tiny 到 large-v3 与蒸馏版),也可手动导入

完成后在任务向导「语音模型」中选择 faster-whisper 的模型即可。

可靠性​

  • 模型加载前自动校验完整性,残缺文件不再导致莫名转写失败,会提示重新下载
  • 与内置引擎一样支持词级时间戳,配合「每条字幕最大字数」按词重新成句
  • 「文字最准」使用更敏感的语音检测(阈值 0.35、最短语音 100 毫秒),优先保留短词和轻声;选择模式即可生效。任务中显式设置的 VAD 参数仍优先。噪声较多时可能增加误识别和耗时,最短静音与边缘留白沿用既有设置,「均衡」「最干净最稳」继续使用原有规则
  • 识别后自动检查语音空档和短促语音,并对可疑片段带前后文局部重听,无需调整复杂参数。只有两次复核的内容一致、置信度足够且前后文能对齐时才自动补入;点击任务中的「已补回」可查看前后对比,并定位复核前的字幕备份
  • 句首词落在长停顿之前时,会尝试在文字完全一致的前提下修正时间轴。复核有次数和音频时长上限,可以随任务取消;复核不可用时保留首次识别结果
  • 独立短词的时间明显错位时,会检查前后文字、原位置的语音证据和两次局部定位;确认后只移动原字幕时间,保留文字与标点。不能确认的时间错位,以及局部重听得到的不同表达,会保留为校对提示;有文字差异时并列显示首次识别与候选,便于试听核对
  • 短词定位的追加确认在原有复核完成后执行,使用独立额度,避免挤掉后续内容和时间检查。追加确认最多 4 次、累计处理音频最多 60 秒;这是音频长度上限,实际耗时取决于设备和模型。额度不足时保留待复核提示
  • 尚不能确认的内容仍显示在校对页,提供时间范围和可复制的重听候选;只有声音活动、没有检出人声的空档保留为低可信度提示。提示是待复核片段数,不等于已确认遗漏的句子数;背景声音、很轻的语音和模型错误仍可能产生误报或漏报

常见问题​

  • 运行时下载失败:在「设置 → 下载源(高级)」切换镜像源或配置代理后重试
  • GPU 运行时要装 CUDA Toolkit 吗:不需要,运行时自带依赖;只要求 NVIDIA 驱动版本不过旧
  • 本地开发者:源码与构建在独立仓库 smartsub-py-engine,见开发说明

信息更新于 2026-07。