跳到主要内容

AI 字幕精修(语义断句与校正)

规则断句只认停顿、标点和字数,所以会出现「连接词吊在行尾」「犹豫停顿把数字劈成两半」这类靠调参数修不掉的问题。AI 字幕精修在转写完成之后、翻译之前,用大模型补上语义这一层:

  • AI 语义断句:把词级时间轴上的转写按语义重新组句。断点由大模型决定,时间仍取每个词的真实时间戳——一共花了三……十五天 不再被停顿切成「花了三|十五天」。
  • AI 字幕校正:逐批修正同音字/错别字、删除「呃、嗯」等语气词、规范标点与英文大小写;不改变字幕条数与时间轴,失败的条目保留原文。

两项都是任务级可选功能,默认关闭;翻译质量也会连带受益——送去翻译的每一条都是完整语义单元。

开启方式

  1. 任务向导 → 配置栏 → 断句与精修 → 断句方式选择 AI 语义断句
  2. 如需文本校正,在同一弹层打开 AI 文本校正 开关(两项可独立使用)
  3. 选择 精修服务商:默认「跟随翻译服务」——翻译选的是 AI 服务商(DeepSeek、通义千问、Ollama 等)时零额外配置;也可以显式指定另一个服务商,比如翻译用大模型、精修用本地小模型省成本
免费方案

精修服务商选择本地 Ollama(如 qwen2.5:7b 级别的模型即可胜任断句任务),全程零 API 成本、文本不出本机。

服务商与模型建议

  • 断句任务本身很简单(在原文里决定断点位置),7B–32B 级别的模型即可;DeepSeek、通义千问、GPT-4o-mini 级别的在线模型表现稳定
  • 校正任务受益于更强的模型(上下文改错),推荐与翻译同级别的模型
  • 弱模型偶发改写原文:系统会校验并带错误反馈重试两轮,仍失败则该段自动回退规则断句——最坏结果等于不开启,不会更差

Token 消耗

  • 语义断句:约消耗全文 2 倍 token(模型需要回显插标后的原文)
  • 字幕校正:约消耗全文 2 倍 token(回显锚定用于检测错位)
  • 一小时视频的转写文本约 8–12k 字,两遍全开在 DeepSeek 上的成本通常在几分钱量级

引擎适配说明

转写引擎断句时间轴
内置 whisper.cpp词级精确(真实词时间戳)
faster-whisper词级精确
云端听写(whisper-1 等词级服务商)词级精确
FunASR / Qwen3-ASR / FireRedASR / Parakeet / 本地 CLI近似(条内按比例插值),界面会提示

内置引擎与 faster-whisper 还会把低置信度的词标注给校正模型(「这些词可能识别错」),定点修正更有把握。

行为边界

  • 精修只作用于本轮 ASR 转写产物:内封字幕提取、配对字幕、用户导入的字幕不会被重新断句
  • 简繁转换与「中文去标点」在精修之后执行,你的字形与标点选项始终最终生效
  • 服务不可达、密钥无效、校验重试耗尽:自动降级为规则断句并记录日志,任务不失败
  • 任务配置快照与配方(Recipe)会记录精修设置;「跟随翻译服务」保存的是跟随语义本身,换任务时随新的翻译服务商重新解析