跳到主要内容

TTS 配音与声音克隆

把字幕变成配音音轨:逐条语音合成、自动对齐时间轴、行级试听与重生成,最后导出纯音频、替换音轨的视频或双音轨 MKV。配合声音克隆,可以用你自己的声音为视频配音。

配音工作台

启动台工具箱点「配音」,或在任务完成后直接衔接。放入一份字幕 + 可选视频即进入工作台:

配音工作台:左侧引擎与音色设置,右侧视频预览与逐行字幕配音列表
  • 左侧声音设置:选择引擎与音色、整体语速、输出形态与背景音策略
  • 右侧逐行列表:每行可独立试听、换音色、重新合成;筛选「过长 / 失败」快速定位问题行
  • 视频预览:实时预览配音与画面的匹配效果

多角色配音

在「角色分离」或校对工作台中保存过角色信息后,配音工作台会自动读取同一字幕的角色数据,并按角色批量设置音色。多人对白需要为每个角色明确选择音色,也可以让某个角色明确跟随全局音色;未分配角色的字幕继续使用全局音色。

  • 单句可以覆盖角色音色,清除覆盖后会重新跟随主要角色
  • 一句包含多个角色时会显示全部角色,但只按主要角色生成一条音轨,避免重叠合成
  • 修改角色或单句音色后,已经生成的旧音频会标记为「需更新」,可按角色或一次性重新生成
  • 切换引擎后若原音色不可用,需要重新选择;存在需更新的音频时不会静默导出

声音来源:三类任选

「音色」页面统一管理全部声音来源:

音色总览:本地模型、在线服务、我的音色三类来源与推荐起步路径
来源内容特点
本地模型Kokoro 多语 v1.1(中 / 英,103 音色)、VITS 中文 AIShell3(174 音色)、ZipVoice 声音克隆免费、离线、无用量限制
在线服务Edge TTS(免费试用档)、OpenAI 兼容端点、Azure Speech(700+ 音色)、火山引擎豆包、ElevenLabs音质更好,按服务商计费
我的音色用参考音频克隆出的专属音色配任意本地 / 云端克隆引擎使用

各服务商的申请与配置步骤见配音服务配置指南

声音克隆:用自己的声音配音

点「添加音色」进入克隆向导,四步完成:选素材 →(自动)选片段 → 参考文本 → 命名保存

创建克隆音色向导:本地 ZipVoice、火山复刻 2.0、ElevenLabs 三种方式

三种克隆方式:

方式特点
本地 ZipVoice零样本克隆,免费、离线、即时可用;一段参考音频即建即用
火山复刻 2.0效果更佳,需在火山控制台购买音色槽位
ElevenLabs 即时克隆(IVC)多语种效果佳,即传即用(需付费套餐)

素材可以选音频 / 视频文件,也可以直接用麦克风录一段。创建时自动做质量检测(时长、信噪比、削波、音量),给出问题定位与修复建议;音色支持导入导出,云端音色误删可从平台取回。

时间轴对齐:配音不跑轴

配音最难的是让语音长度贴合字幕时间轴,妙幕用三层机制处理:

  1. 语速预控制:合成前按目标时长预控语速
  2. 实测复核:合成后实测时长复核——本地引擎免费重合成,云端用 atempo 变速
  3. 间隙借用:仍不足时向相邻静音间隙借用时间

超过 1.5 倍语速红线的行会进入人工处理清单:改文案、单行重生成,或接受变速,由你决定。

输出形态

  • 纯音频:wav / mp3 配音轨
  • 替换音轨的视频:原视频画面 + 配音音轨
  • 混音视频:原音轨压低(ducking)+ 配音叠加
  • MKV 双音轨:原音轨与配音轨并存,播放器切换
  • 可同时导出对齐后的字幕(时间轴与配音一致)

背景音策略支持「静音原轨(仅保留配音)」或「压低原轨」。本地配音合成多进程并行,批量任务近线性提速;本地语音引擎隔离运行,异常不影响主程序。

下一步