Почему ИИ-субтитры переписывают сами себя (и другие секреты синхронного перевода речи)
Newey Team

Синхронный перевод речи — это потоковый конвейер: распознавание речи (ASR) превращает звук в текст, пока вы говорите, машинный перевод (MT) переводит этот текст на целевой язык, а для голосового вывода синтез речи озвучивает результат. Современные системы показывают переведённые субтитры примерно через 1–4 секунды после произнесённых слов — что сопоставимо с лагом в 2–6 секунд у профессиональных синхронных переводчиков-людей. Точность на чистом звуке уже приближается к человеческой транскрипции на стандартных бенчмарках — но шум, акценты и специальная лексика могут резко её обрушить, и бо́льшая часть этих потерь возвращается хорошим микрофоном и пользовательским глоссарием. Вот как всё это устроено под капотом, с реальными цифрами.
Конвейер: как речь становится переведёнными субтитрами
Большинство сегодняшних продакшн-систем — каскадные: отдельные модели, соединённые в цепочку. Как описывает Google Research, системы перевода речи «обычно разбивались на три отдельных компонента: автоматическое распознавание речи для транскрипции исходной речи в текст, машинный перевод для перевода транскрибированного текста и синтез речи для его озвучивания». Для субтитров третий этап пропускается — переведённый текст и есть продукт.
У каскада есть известная слабость, которую исследователи называют распространением ошибок: если распознаватель ослышался, переводчик добросовестно переводит неверное слово. Академические работы по переводу речи отмечают, что каскадные системы «обычно критикуют за распространение ошибок между моделями автоматического распознавания речи и машинного перевода» (Xu et al., 2025). Именно поэтому этап распознавания — и всё, что ему помогает, вроде качества звука и подсказок по лексике, — в переводном конвейере важен вдвойне.
Сквозные (end-to-end) модели, переводящие прямо из аудио (линейка Translatotron у Google и новейшие системы «голос в голос»), избегают этого накопления ошибок, но по состоянию на 2026 год каскадный подход по-прежнему стоит за большинством продуктов живого субтитрования — каждый этап можно обучать на куда большем объёме данных.
Почему живые субтитры переписывают сами себя
Если вы наблюдали за живыми субтитрами, вы видели, как слова появляются, а потом меняются. Это не глюк — это ключевой механизм потокового распознавания.
Потоковый ASR выдаёт два типа результатов:
- Частичные (промежуточные) результаты — лучшая догадка движка на данный момент, помеченная как нестабильная и «подлежащая изменению», пока звук ещё поступает. Google Cloud Speech-to-Text даже прикрепляет к каждому частичному результату оценку
stability— насколько вероятно, что он будет пересмотрен. - Финальные результаты — зафиксированный текст, выдаваемый, когда движку хватает контекста (обычно на паузе или границе фразы). Служба Speech в Azure делает то же различие между событиями
Recognizing(промежуточное) иRecognized(финальное).
Причина пересмотров — лингвистическая: более поздние слова снимают неоднозначность более ранних. «I scream» и «ice cream» звучат одинаково, пока не придёт дополнительный контекст. Переводной конвейер наследует это поведение — и добавляет своё, потому что многие языки ставят глаголы или отрицания там, где переводчику приходится ждать или переписывать. Хорошие системы субтитров тонко настраивают этот баланс между показать текст быстро и показать текст, который не изменится.
Насколько быстро «реальное время»?
Цифры из документации вендоров и инженерных гайдов по состоянию на 2026 год:
Покомпонентные цифры — из отраслевых инженерных гайдов (Fora Soft, Translated); в неблагоприятных условиях реальные суммарные значения складываются в 2–6 секунд, при этом менее ~3 секунд обычно считается приемлемым для живых мероприятий.
А вот контекст, который многих удивляет: у синхронных переводчиков-людей тот же лаг. Академическая мера — интервал «ухо–голос» (ear-voice span), задержка между услышанным и произнесённым, — и исследования помещают её между 2 и 6 секундами, со средними значениями примерно от 2,7 до 4,7 секунды (обзор исследований UCL). Лаг за ~4 секунды и у людей связан с потерей точности. Хорошо настроенный конвейер ИИ-субтитров сидит ровно в диапазоне задержек переводчика-человека.
Насколько точно распознавание речи на самом деле?
Стандартная метрика — word error rate (WER), доля ошибок в словах: замены + пропуски + вставки, делённые на число реально произнесённых слов. WER 10% значит, что каждое десятое слово в чём-то неверно.
Честный ответ на вопрос «насколько точно?» такой: колоссально зависит от условий.
- Чистая, разборчивая речь: статья о Whisper от OpenAI сообщает ~2,5–2,7% WER на чистом бенчмарке LibriSpeech — примерно человеческий уровень на этом бенчмарке, — отмечая при этом, что на более разнообразных реальных данных модели всё ещё делают примерно вдвое больше ошибок, чем люди.
- Разговорная телефонная речь: знаменитый результат Microsoft о «человеческом паритете» — 5,1% WER на бенчмарке Switchboard в 2017 году — с собственной оговоркой Microsoft, что шумные помещения, удалённые микрофоны и акцентная речь остались нерешёнными.
- Дальние микрофоны, речь внахлёст: отрезвляющая точка данных — челлендж CHiME-6 (записи «званого ужина» через комнатные микрофоны): даже победившая система показала ~40% WER, а базовая — ~51%.
- Акценты и диалекты: исследование в PNAS пяти крупных коммерческих ASR-систем нашло средний WER 0,35 для чернокожих американских носителей против 0,19 для белых — разрыв, прослеженный до покрытия обучающих данных. Неродные акценты сталкиваются с той же механикой.
- Смешанная речь: переключение кодов (вкрапление английских терминов в корейскую, хинди и т. д. речь) остаётся крупным источником сбоев — вендоры сообщают о росте WER на 30–50% относительно одноязычной речи.
Вывод не «ИИ точен на 97%» и не «ИИ непригоден» — а то, что одна и та же система может быть почти безупречной в тихой комнате с хорошим микрофоном и сильно деградировать в гулком зале с перекрёстными разговорами.
Качество перевода наслаивается сверху
У этапа MT свои меры качества — метрики n-граммного совпадения вроде BLEU и нейронные метрики вроде COMET, которые лучше коррелируют с человеческой оценкой. Но для живых субтитров практическое правило проще: качество перевода ограничено качеством распознавания. Идеально переведённая ослышка всё равно неверна, а исковерканное название продукта коверкается сразу на всех целевых языках.
Что действительно повышает точность
В примерном порядке влияния:
- Микрофон и расстояние. Разрыв между бенчмарочным WER (~3–5%) и WER «званого ужина» (~40%) — это в основном акустика. Гарнитура или микрофон на расстоянии вытянутой руки бьют любое обновление модели.
- Один говорящий за раз. Речь внахлёст — самая трудная открытая проблема ASR; дисциплина встречи — это фича точности.
- Пользовательская лексика / глоссарий. Каждый крупный движок поддерживает смещение распознавания к ожидаемым терминам: адаптация модели у Google использует наборы фраз для усиления «имён собственных и отраслевых слов», а списки фраз в Azure дают канонический пример: «Contoso bank» распознаётся как «can't do so bank», пока термин не зарегистрирован. Скормить системе названия продуктов, имена участников и отраслевые термины до встречи — самое высокорычажное программное средство.
- Контекст. Сказать системе, о чём сессия (доклад по онкологии или ретро спринта), помогает и распознаванию, и переводу выбирать правильные значения многозначных слов.
- Привычки докладчика. Умеренный темп и законченные предложения помогают — то же самое, что помогает переводчикам-людям, которые работают парами и сменяются каждые 20–30 минут именно потому, что это когнитивно беспощадная работа (AIIC).
Действительно ли живые субтитры помогают следить за происходящим?
Да — и не только там, где есть перевод. Обзор исследований в Policy Insights from the Behavioral and Brain Sciences констатирует: «более 100 эмпирических исследований документируют, что субтитры к видео улучшают его понимание, внимание к нему и его запоминание», с особенно сильным эффектом для тех, кто смотрит на неродном языке. Добавьте измерение доступности — ВОЗ насчитывает 1,5 миллиарда человек с той или иной степенью потери слуха, с прогнозом до 2,5 миллиарда к 2050 году — и субтитры перестают быть просто приятным бонусом для международных встреч.
Что это значит на практике
Если вы оцениваете живой перевод для встреч или мероприятий, вся эта статья сжимается до четырёх вопросов: Насколько близко микрофон к говорящему? Можете ли вы загрузить свою лексику заранее? Укладывается ли задержка в диапазон переводчика-человека (2–6 с)? И может ли каждый слушатель получить свой язык?
Вокруг последнего набора мы и построили Newey: он передаёт звук вашей встречи или мероприятия прямо из браузера в конвейер распознавания и перевода, показывает субтитры в плавающем оверлее в пределах описанных выше задержек, поддерживает пользовательские глоссарии и контекст сессии для проблемы лексики и переводит на 60 языков — до 3 одновременно, с QR-опцией, чтобы каждый человек в зале читал свой язык на своём телефоне. Он бесплатен в период беты, так что можете проверить эти заявления о точности на собственных встречах.
Взгляд организатора на все варианты — переводчики-люди, встроенные функции платформ и ИИ-субтитры — в статье Как провести многоязычную встречу.
FAQ
Так же ли точен ИИ-перевод речи, как переводчик-человек?
Они по-разному ошибаются. На чистом звуке с обычной лексикой современный ASR приближается к точности человеческой транскрипции на стандартных бенчмарках; в шумных помещениях, при сильных акцентах или смешанной речи люди по-прежнему уверенно выигрывают. Люди к тому же сжимают и приоритизируют смысл под давлением, тогда как ИИ переводит всё буквально — включая то, что человек мудро опустил бы.
Почему субтитры появляются, а потом меняются?
Потоковые распознаватели сразу выдают предварительные «частичные» результаты, а затем заменяют их «финальными», когда набирается контекст (это двухфазное поведение документируют и Google, и Azure). Более поздние слова действительно меняют смысл более ранних звуков.
Какую задержку ждать от живых переведённых субтитров?
Примерно 1–4 секунды в хороших условиях. Для калибровки: у профессиональных синхронных переводчиков-людей интервал «ухо–голос» составляет 2–6 секунд.
Что такое WER?
Word error rate, доля ошибок в словах — доля слов, которые распознаватель передал неверно (заменил, пропустил или вставил), относительно реально сказанного. Это стандартная метрика точности распознавания речи.
Действительно ли фоновый шум так важен?
Это самый большой фактор. Тот же класс моделей, что набирает ~3–5% WER на чистых бенчмарках, показал ~40% WER в челлендже CHiME-6 с удалёнными микрофонами. Сначала почините микрофон, потом всё остальное.
Как не дать системе коверкать названия наших продуктов?
Используйте глоссарий / пользовательскую лексику. Регистрация отраслевых терминов до сессии — ровно то, для чего существуют API фразового смещения у речевых движков, и это самое действенное средство после качества звука.
Читайте также: Как провести многоязычную встречу · Переведённые субтитры Zoom · Переведённые субтитры Google Meet