全部文章

AI 字幕为什么会自己改写?实时语音翻译的原理与真实数据

Newey Team

实时语音翻译是一条流式管线:**语音识别(ASR)**在你讲话的同时把音频转成文字,机器翻译(MT)把文字转换成目标语言,如需语音输出,再由文本转语音读出来。现代系统能在话音落下后约 1–4 秒内显示翻译字幕,与专业人工同传 2–6 秒的滞后相当。在清晰音频上,识别准确率已在标准基准上接近人类转写水平 — 但噪音、口音和专业词汇会让它急剧下降,而其中大部分损失可以靠一支好麦克风和一份自定义词汇表挽回。下面用真实数字讲清整套机制的底层原理。

管线:语音如何变成翻译字幕

今天多数生产系统采用**级联(cascaded)**架构:多个独立模型串联。正如 Google Research 所描述的,语音翻译“系统通常被拆成三个独立组件:自动语音识别把源语音转写为文本,机器翻译翻译转写文本,文本转语音进行合成”。对字幕来说,第三级被跳过 — 翻译后的文字就是产品。

级联架构有一个众所周知的弱点,研究者称之为误差传播(error propagation):如果识别器听错一个词,翻译器会忠实地翻译那个错词。语音翻译领域的学术研究指出,级联系统“常因自动语音识别与机器翻译模型之间的误差传播而受到批评”(Xu et al., 2025)。这正是识别环节 — 以及一切有助于它的东西,如音频质量和词汇提示 — 在翻译管线中加倍重要的原因。

直接从音频翻译的端到端模型(Google 的 Translatotron 系列,以及最新的语音到语音系统)避免了这种误差叠加,但截至 2026 年,级联方案仍然驱动着大多数实时字幕产品,因为每一级都能用多得多的数据训练。

实时字幕为什么会自己改写

如果你看过实时字幕,你一定见过文字先出现、然后又变化。那不是故障 — 那是流式识别的核心机制。

流式 ASR 输出两种结果:

  • 部分(中间)结果 — 引擎到目前为止的最佳猜测,在音频仍在流入时被标记为不稳定、“可能被修改”。Google Cloud 的 Speech-to-Text 甚至给每条部分结果附上一个 stability 分数,估计它被改写的可能性。
  • 最终结果 — 锁定的文字,在引擎获得足够上下文后输出(通常在停顿或短语边界处)。Azure 的语音服务做同样的区分:Recognizing(中间)与 Recognized(最终)事件。

改写的原因是语言学层面的:后面的词会消解前面词的歧义。“I scream”和“ice cream”在更多上下文到来之前听起来一模一样。翻译管线继承了这种行为 — 还会加上自己的一层,因为许多语言把动词或否定词放在迫使翻译器等待或重写的位置上。好的字幕系统会精心调校快速出字出不再变的字之间的取舍。

“实时”到底有多快?

来自厂商文档和工程指南的数字,截至 2026 年:

环节典型延迟
流式语音识别约 270–520 毫秒
机器翻译约 100–400 毫秒
端到端字幕延迟(真实环境)约 1–4 秒
某 RSI 平台文档记载的默认值句子完成后约 4 秒(Interprefy

分项数字来自行业工程指南(Fora SoftTranslated);不利条件下真实总延迟会累积到 2–6 秒,而 3 秒以内通常被认为对现场活动可以接受。

接下来是让很多人意外的背景知识:人工同传有同样的滞后。 学术上的度量是听说时差(ear-voice span) — 从听到到说出之间的延迟 — 研究测得它在 2 到 6 秒之间,报告的均值约为 2.7 到 4.7 秒(UCL 研究综述)。超过约 4 秒的滞后在人类身上同样伴随准确率下降。一条调校良好的 AI 字幕管线,正好落在人工同传自己的延迟区间内。

语音识别到底有多准?

标准指标是词错误率(WER):替换 + 删除 + 插入的总数,除以实际说出的词数。WER 10% 意味着每十个词就有一个在某种意义上错了。

对“有多准”的诚实回答是:极度取决于条件。

  • 干净清晰的语音:OpenAI 的 Whisper 论文报告在 LibriSpeech clean 基准上约 2.5–2.7% 的 WER — 在该基准上大致达到人类水平 — 但同时指出在更多样的真实数据集上,模型的错误仍约为人类的两倍
  • 电话交谈语音:Microsoft 著名的“人类对等”成果在 2017 年的 Switchboard 基准上达到 5.1% WER — Microsoft 自己也附注:嘈杂环境、远距离麦克风和带口音的语音仍未解决。
  • 远距离麦克风、多人抢话CHiME-6 挑战赛(用房间麦克风录制的晚餐聚会)是最清醒的数据点 — 夺冠系统的 WER 仍约 40%,基线约 51%。
  • 口音与方言:一项 PNAS 研究测试五大商用 ASR 系统,发现美国黑人说话者的平均 WER 为 0.35,白人说话者为 0.19 — 差距可追溯到训练数据覆盖。非母语口音面对同样的机制。
  • 混合语言语音:语码转换(在韩语、印地语等语句中夹杂英文词)仍是重大失效模式,厂商报告其 WER 相对单语语音上升 30–50%

结论不是“AI 有 97% 准确率”,也不是“AI 不可用” — 而是同一套系统在安静房间加好麦克风时可以近乎完美,在混响大厅加互相抢话时会严重退化。

翻译质量叠加在识别之上

MT 环节有自己的质量指标 — n-gram 重叠类分数如 BLEU,以及与人类判断相关性更好的神经指标如 COMET。但对实时字幕而言,实用规则更简单:翻译质量的上限就是识别质量。 一句被完美翻译的误听仍然是错的,一个被听岔的产品名会同时在每种目标语言里出错。

真正能提升准确率的做法

按影响力大致排序:

  1. 麦克风与距离。 基准 WER(约 3–5%)与晚餐聚会 WER(约 40%)之间的差距主要是声学问题。一副头戴式耳麦或一支一臂之内的麦克风,胜过任何模型升级。
  2. 一次一人发言。 重叠语音是 ASR 最难的开放问题 — 会议纪律本身就是一项准确率功能。
  3. 自定义词汇 / 词汇表。 所有主流引擎都支持把识别偏向预期术语:Google 的模型自适应用短语集提升“专有名词或领域专用词”的权重;Azure 的短语列表给出了经典示例:“Contoso bank”在登记该词条之前会被听成“can't do so bank”。在会前把产品名、与会者姓名和行业术语喂给系统,是杠杆最高的软件层修复。
  4. 上下文。 告诉系统这场会在讲什么(一场肿瘤学主旨演讲 vs 一次冲刺回顾会),能帮识别和翻译同时为歧义词选对含义。
  5. 发言人习惯。 语速适中、说完整句子有帮助 — 这些同样帮助人工口译员,他们之所以两人一组、每 20–30 分钟轮换,正是因为这件事对认知的消耗极其残酷(AIIC)。

实时字幕真的能帮人跟上吗?

能 — 而且不只在涉及翻译时。发表于 Policy Insights from the Behavioral and Brain Sciences 的一篇研究综述发现,“100 多项实证研究证明,为视频加字幕能提升对视频的理解、注意与记忆”,对以非母语观看的人受益尤其显著。再加上无障碍维度 — WHO 统计全球有 15 亿人存在某种程度的听力损失,预计 2050 年达 25 亿 — 字幕对国际会议来说早已不是可有可无。

这在实践中意味着什么

如果你正在为会议或活动评估实时翻译,这篇文章可以压缩成四个问题:麦克风离发言人有多近?能否提前载入你的词汇?延迟是否在人工同传区间(2–6 秒)内?每位听众能否得到自己需要的语言?

最后这组问题正是我们打造 Newey 的出发点:它把你的会议或活动音频直接从浏览器送入识别加翻译的管线,在上述延迟区间内以悬浮层显示字幕,用自定义词汇表和会话上下文解决词汇问题,并翻译成 60 种语言 — 最多同时显示 3 种,还可用二维码让每位观众在手机上阅读自己的语言。公测期间免费,你可以拿自己的会议来检验这里的准确率结论。

想从组织者视角纵览所有方案 — 人工口译、平台内置、AI 字幕 — 见如何开好一场多语言会议

FAQ

AI 语音翻译和人工口译员一样准吗?

失效方式不同。在音频清晰、词汇常见时,现代 ASR 在标准基准上接近人类转写准确率;在嘈杂房间、重口音或混合语言语音下,人类仍然明显更强。人类还会在压力下压缩和取舍语义,而 AI 把一切照字面翻译 — 包括人类会明智省略的部分。

字幕为什么先出现又变化?

流式识别器会立即输出临时的“部分”结果,等上下文足够后再用“最终”结果替换(GoogleAzure 都记载了这种两阶段行为)。后面的词确实会改变前面声音的含义。

实时翻译字幕应该预期多大延迟?

良好条件下约 1–4 秒。作为参照:专业人工同传的听说时差为 2–6 秒。

什么是 WER?

词错误率(word error rate)— 识别器出错的词(被替换、删除或插入)占实际所说词数的比例。它是语音识别的标准准确率指标。

背景噪音真的影响那么大吗?

它是最大的单一因素。在干净基准上得分约 3–5% WER 的同一类模型,在 CHiME-6 远距离麦克风挑战中打出了约 40% 的 WER。先解决麦克风,再谈其他。

怎么避免系统把我们的产品名翻得乱七八糟?

用词汇表/自定义词汇功能。在会前登记领域术语,正是语音引擎的短语偏置 API 存在的意义,也是音频质量之后影响最大的修复手段。


延伸阅读:如何开好一场多语言会议 · Zoom 翻译字幕 · Google Meet 翻译字幕