faster-whisper
本地离线 · 数据不出本机
- 凭据
- 无需凭据
- 免费额度
- 完全免费
- 计费方式
- 本地运行,无费用
- 推荐场景
- 追求速度与精度的用户;NVIDIA 显卡可用 GPU 运行时
基于 CTranslate2 的 whisper 实现,同级模型下速度通常快于原版。运行时与模型都在应用内按需下载,无需自己折腾 Python 环境。
在妙幕中配置
「引擎」页面选中「faster-whisper」:
- 安装运行时:首次使用点安装,应用会下载一个自包含运行时(独立于系统 Python)
- 选择计算设备:CPU 或 GPU(NVIDIA CUDA)。两种运行时可以共存——切换不再重复下载,旧运行时本地驻留,切回秒级完成、可离线;卸载引擎时一并清理
- 下载模型:模型按需从 HuggingFace / 镜像源下载(tiny 到 large-v3 与蒸馏版),也可手动导入
完成后在任务向导「语音模型」中选择 faster-whisper 的模型即可。
可靠性
- 模型加载前自动校验完整性,残缺文件不再导致莫名转写失败,会提示重新下载
- 与内置引擎一样支持词级时间戳,配合「每条字幕最大字数」按词重新成句
- 「文字最准」使用更敏感的语音检测(阈值 0.35、最短语音 100 毫秒),优先保留短词和轻声;选择模式即可生效。任务中显式设置的 VAD 参数仍优先。噪声较多时可能增加误识别和耗时,最短静音与边缘留白沿用既有设置,「均衡」「最干净最稳」继续使用原有规则
- 识别后自动检查语音空档和短促语音,并对可疑片段带前后文局部重听,无需调整复杂参数。只有两次复核的内容一致、置信度足够且前后文能对齐时才自动补入;点击任务中的「已补回」可查看前后对比,并定位复核前的字幕备份
- 句首词落在长停顿之前时,会尝试在文字完全一致的前提下修正时间轴。复核有次数和音频时长上限,可以随任务取消;复核不可用时保留首次识别结果
- 独立短词的时间明显错位时,会检查前后文字、原位置的语音证据和两次局部定位;确认后只移动原字幕时间,保留文字与标点。不能确认的时间错位,以及局部重听得到的不同表达,会保留为校对提示;有文字差异时并列显示首次识别与候选,便于试听核对
- 短词定位的追加确认在原有复核完成后执行,使用独立额度,避免挤掉后续内容和时间检查。追加确认最多 4 次、累计处理音频最多 60 秒;这是音频长度上限,实际耗时取决于设备和模型。额度不足时保留待复核提示
- 尚不能确认的内容仍显示在校对页,提供时间范围和可复制的重听候选;只有声音活动、没有检出人声的空档保留为低可信度提示。提示是待复核片段数,不等于已确认遗漏的句子数;背景声音、很轻的语音和模型错误仍可能产生误报或漏报
常见问题
- 运行时下载失败:在「设置 → 下载源(高级)」切换镜像源或配置代理后重试
- GPU 运行时要装 CUDA Toolkit 吗:不需要,运行时自带依赖;只要求 NVIDIA 驱动版本不过旧
- 本地开发者:源码与构建在独立仓库 smartsub-py-engine,见开发说明
信息更新于 2026-07。