跳到主要内容

字幕生成(语音转写)

把视频 / 音频里的人声转成带时间轴的字幕文件。这是妙幕流水线的第一环,支持批量处理、多引擎切换与硬件加速。

基本流程

  1. 在启动台选择「视频 → 原文字幕」(或任何包含转写的任务),把文件拖进任务向导
  2. 在「字幕设置」里选择语音模型视频源语言字幕格式
  3. 点「开始」批量处理,完成后字幕文件默认生成在视频同目录
任务向导中的字幕设置:语音模型、视频语言与字幕格式

支持常见的视频(mp4 / mkv / mov / avi …)与音频(mp3 / wav / m4a / flac …)格式;并发任务数可在任务设置中调整。

八类转写引擎

转写引擎可以逐任务切换,在「引擎」页面统一安装与管理:

引擎特点运行方式
whisper.cpp(内置)默认引擎,ggml 量化模型 + GPU 加速,低配电脑也能流畅跑随应用内置,开箱即用
faster-whisper基于 CTranslate2,速度更快、精度更高自包含运行时(应用内下载)
FunASRSenseVoice(中 / 英 / 日 / 韩 / 粤)与 Paraformer-zh,中文表现优秀内置 sherpa-onnx,无需额外环境
Qwen3-ASR通义千问语音识别(qwen3-asr-0.6b / 1.7b)内置 sherpa-onnx,无需额外环境
FireRedASRFireRedASR-AED large(中英),中文表现优秀内置 sherpa-onnx,无需额外环境
NVIDIA ParakeetParakeet TDT 0.6B v3,英文与 25 种欧洲语言,自动标点及大小写内置 sherpa-onnx,无需额外环境
本地 Whisper CLI调用你自行安装的 whisper 兼容命令使用系统已装命令
云端听写8 家在线服务商,免 GPU 免模型,部分有免费额度在线服务(音频上传到配置的端点)
  • 引擎选型与逐个安装说明见转写引擎总览
  • 中文内容推荐 FunASR / FireRedASR;英文与欧洲语言可试 Parakeet;没有显卡且不想下载模型时推荐云端听写
  • whisper 系模型怎么选(tiny 到 large、量化版本)见模型选择与导入

字幕效果档位

不想调参数的话,直接选效果档位:按「快速草稿 / 均衡 / 精细」等使用意图自动派生底层识别参数(VAD 切分、时间戳策略等),几乎无需手动调参。

需要精细控制时,任务高级设置提供:

  • 每条字幕最大字数:有词级时间戳的引擎(whisper.cpp / faster-whisper / 云端听写)按真实词级时间重新成句;其余引擎按文本比例兜底拆分
  • 断句设置:三态控制——严格不拆词 / 允许适度拆分 / 不限长度
  • 中文去标点、简繁转换:中文字幕可选去除标点、简体繁体互转

时间轴质量

  • 内置 whisper.cpp 引擎使用 Silero VAD 智能分段并设定最小显示时长,断句与时间对齐更自然
  • 字幕显示按语音结束时间收敛,减少「字幕滞留」
  • 超长音频(4 小时以上)自动在静音处分段处理,时间轴无缝合并,不再爆内存

角色分离

标准的「转写」和「转写 + 翻译」任务可在高级设置中开启角色分离。它会在转写、精修与翻译完成后,本地分析整段音频,把不同角色按时间轴对齐到每条字幕;处理耗时与音频长度大致成正比。

首次使用前需在「资源中心 → 本地多模型引擎」确认运行库可用并下载角色分离模型。角色信息默认只保存在应用内校对数据中,不会改变导出的字幕;需要交付可读标签时,可同时开启「将角色标签写入字幕文件」,初始输出使用 [Speaker 1] 等前缀。进入校对台后可以把编号改为真实角色名、纠正归属,并决定保存时是否写入当前角色名称。

当前版本暂不在一条龙向导、自定义配方及含配音 / 合成的流程中开放角色分离;这些流程会在角色元数据与配音音色映射完成后再接入。

用参考文稿校正转写

课程、演讲或成片已有 TXT / Markdown 文稿时,可在任务的「参考文稿」中选择它。妙幕会在转写后按顺序对齐文稿与字幕,只把达到安全置信度的文本写回,并始终保留 ASR 生成的字幕条数和时间轴。

  • 支持 UTF-8、UTF-16、GBK / GB18030 编码、最大 1 MiB 的 .txt.md.markdown
  • 可跨过没有念出的标题、列表和舞台说明,并处理文稿与字幕分句粒度不一致
  • 低置信片段保持原识别文本;文稿为空、被移动或读取失败时整项安全回退,不会令转写任务失败
  • 任务轨道会显示已匹配条数及回退状态;匹配后的文本继续进入翻译、校对和导出

GPU 加速

平台加速后端
Windows / Linux + NVIDIACUDA(应用内下载)
Windows / Linux + AMD / IntelVulkan(已内置)
macOS Apple 芯片Core ML / Metal
任意平台CPU 自动回退

无需手动安装 CUDA Toolkit,详见 GPU 加速

实用细节

  • 自定义字幕文件名:按模板生成文件名(如 视频名.zh.srt),方便不同播放器自动挂载识别
  • 官方字幕优先:经视频下载获取的在线视频若带官方字幕,会自动配对,无需再转写
  • 误命名兼容:导入的字幕文件即使扩展名不对,也会自动探测真实格式
  • 模型完整性校验:faster-whisper 模型加载前自动校验完整性,避免残缺文件导致的转写异常

下一步