TTS 配音与声音克隆
把字幕变成配音音轨:逐条语音合成、自动对齐时间轴、行级试听与重生成,最后导出纯音频、替换音轨的视频或双音轨 MKV。配合声音克隆,可以用你自己的声音为视频配音。
配音工作台
启动台工具箱点「配音」,或在任务完成后直接衔接。放入一份字幕 + 可选视频即进入工作台:

- 左侧声音设置:选择引擎与音色、整体语速、输出形态与背景音策略
- 右侧逐行列表:每行可独立试听、换音色、重新合成;筛选「过长 / 失败」快速定位问题行
- 视频预览:实时预览配音与画面的匹配效果
多角色配音
在「角色分离」或校对工作台中保存过角色信息后,配音工作台会自动读取同一字幕的角色数据,并按角色批量设置音色。多人对白需要为每个角色明确选择音色,也可以让某个角色明确跟随全局音色;未分配角色的字幕继续使用全局音色。
- 单句可以覆盖角色音色,清除覆盖后会重新跟随主要角色
- 一句包含多个角色时会显示全部角色,但只按主要角色生成一条音轨,避免重叠合成
- 修改角色或单句音色后,已经生成的旧音频会标记为「需更新」,可按角色或一次性重新生成
- 切换引擎后若原音色不可用,需要重新选择;存在需更新的音频时不会静默导出
声音来源:三类任选
「音色」页面统一管理全部声音来源:

| 来源 | 内容 | 特点 |
|---|---|---|
| 本地模型 | Kokoro 多语 v1.1(中 / 英,103 音色)、VITS 中文 AIShell3(174 音色)、ZipVoice 声音克隆 | 免费、离线、无用量限制 |
| 在线服务 | Edge TTS(免费试用档)、OpenAI 兼容端点、Azure Speech(700+ 音色)、火山引擎豆包、ElevenLabs | 音质更好,按服务商计费 |
| 我的音色 | 用参考音频克隆出的专属音色 | 配任意本地 / 云端克隆引擎使用 |
各服务商的申请与配置步骤见配音服务配置指南。
声音克隆:用自己的声音配音
点「添加音色」进入克隆向导,四步完成:选素材 →(自动)选片段 → 参考文本 → 命名保存。

三种克隆方式:
| 方式 | 特点 |
|---|---|
| 本地 ZipVoice | 零样本克隆,免费、离线、即时可用;一段参考音频即建即用 |
| 火山复刻 2.0 | 效果更佳,需在火山控制台购买音色槽位 |
| ElevenLabs 即时克隆(IVC) | 多语种效果佳,即传即用(需付费套餐) |
素材可以选音频 / 视频文件,也可以直接用麦克风录一段。创建时自动做质量检测(时长、信噪比、削波、音量),给出问题定位与修复建议;音色支持导入导出,云端音色误删可从平台取回。
时间轴对齐:配音不跑轴
配音最难的是让语音长度贴合字幕时间轴,妙幕用三层机制处理:
- 语速预控制:合成前按目标时长预控语速
- 实测复核:合成后实测时长复核——本地引擎免费重合成,云端用 atempo 变速
- 间隙借用:仍不足时向相邻静音间隙借用时间
超过 1.5 倍语速红线的行会进入人工处理清单:改文案、单行重生成,或接受变速,由你决定。
输出形态
- 纯音频:wav / mp3 配音轨
- 替换音轨的视频:原视频画面 + 配音音轨
- 混音视频:原音轨压低(ducking)+ 配音叠加
- MKV 双音轨:原音轨与配音轨并存,播放器切换
- 可同时导出对齐后的字幕(时间轴与配音一致)
背景音策略支持「静音原轨(仅保留配音)」或「压低原轨」。本地配音合成多进程并行,批量任务近线性提速;本地语音引擎隔离运行,异常不影响主程序。
下一步
- 配好的音轨连同字幕合成到视频
- 完整出海流程照做:视频出海:翻译字幕并配外语音轨