Как работает распознавание речи: от звуковой волны до готового текста

РАЗБОР

Как работает распознавание речи: от звуковой волны до готового текста

Ошибки в расшифровке не случайны: у каждой свой шаг обработки. Показываем цепочку от звуковой волны до готового текста и то, что можно поправить самому — ещё на записи.

Ошибки в расшифровке не случайны

Час совещания, распознавание речи отработало за несколько минут, текст готов. Читаешь — и почти всё на месте, кроме четырёх мест: дата съехала на десяток лет, фамилия подрядчика превратилась в обычное слово, название продукта записано наугад, а минута, где заговорили втроём, слиплась в невнятный абзац.

Набор пострадавших мест почти всегда один и тот же — и это уже подсказка. Ошибки распознавания не рассыпаны по тексту случайно: каждая приходит с конкретного шага обработки. По виду ошибки почти всегда можно сказать, на каком шаге она родилась, и, что важнее, стоит ли с ней вообще бороться.

Пять шагов, из которых складывается распознавание речи

Ничего мистического в этой цепочке нет: она устроена как конвейер, где каждый следующий участок работает уже не с живым голосом, а с тем, что от него осталось после предыдущего.

Конвейер работает в одну сторону: каждый следующий участок видит уже не голос, а результат предыдущего. Дальше — по шагу на раздел.

Шаг 1. Воздух становится числами

Голос — это колебания давления воздуха. Микрофон превращает их в электрический сигнал, а запись измеряет этот сигнал много тысяч раз в секунду и сохраняет числа. Частота измерений задаёт потолок: чтобы звук какой-то частоты вообще попал в файл, измерять надо чаще, чем вдвое быстрее самой этой частоты. Это теорема Котельникова, и обойти её нечем.

Отсюда вся разница между записями. Обычный телефонный канал измеряет сигнал восемь тысяч раз в секунду и пропускает полосу примерно от 300 до 3400 герц — всё, что выше, отрезано ещё до того, как файл появился на свет. Широкополосная запись речи вдвое подробнее и сохраняет верхнюю часть спектра, где как раз и различаются шипящие. Ни один шаг дальше по конвейеру не вернёт того, чего в файле нет.

Ни один следующий шаг не вернёт того, чего в файле нет. Разница между «с» и «ш» живёт как раз наверху, за границей телефонной полосы.

Шаг 2. Запись режется на короткие окна

Речь непрерывна, а разбирать её удобно кусками. Сигнал делят на окна длиной в пару десятков миллисекунд — примерно так же поступают речевые кодеки, которые работают кадрами по десять-двадцать миллисекунд. Длина выбрана не наугад: за такое время артикуляция почти не успевает измениться, то есть внутри окна звук можно считать однородным, а от окна к окну уже видно движение.

Длина выбрана не наугад: за это время артикуляция почти не успевает измениться, поэтому внутри окна звук считают однородным, а от окна к окну видно движение.

Шаг 3. Из окна получается спектр

Для каждого окна считают спектр — распределение энергии по частотам: где звук густой, где пустой. Так речь превращается из волны в картинку, на которой звуки речи различимы. Гласные дают устойчивые полосы энергии на своих местах, свистящие и шипящие — шум в верхней части спектра, взрывные — короткое смыкание и всплеск после него.

Так речь превращается из волны в картинку, на которой звуки различимы. Если верхней части в файле нет, на месте выбора между похожими согласными остаётся догадка.

Здесь становится понятно, почему узкая полоса обходится так дорого. Разница между «с» и «ш» живёт наверху, за границей телефонного канала. Если этой части в файле нет, различать нечего: на месте выбора между похожими согласными остаётся догадка.

Шаг 4. Звуки складываются в слова

На этом шаге и живёт главное недоразумение: кажется, будто система «слышит слова». На самом деле она перебирает варианты. Для каждого отрезка есть несколько правдоподобных звуковых гипотез, и из них собирается такая последовательность слов, которая одновременно похожа на звук и осмысленна как русская фраза. За вторую половину отвечает языковая модель — представление о том, какие слова в языке бывают и какие из них обычно ходят друг за другом.

Из этого следуют два свойства, объясняющие почти все странности расшифровок. Первое: при равном звуке частое слово побеждает редкое. Второе: пустого места система почти не оставляет — если звука мало, она подставит то, что вероятнее. Поэтому ошибки читаются гладко: глаз о них не спотыкается, а факт в тексте уже неверный.

Отсюда обе странности расшифровок: ошибки читаются гладко, потому что подставлено обычное слово, и пустых мест в тексте почти не бывает.

Шаг 5. Текст оформляется

Слова есть, а знаков препинания в устной речи не существует: в звуке нет ни точки, ни абзаца. Пунктуация и заглавные буквы расставляются последним шагом — уже по словам, по строению фразы и по паузам. Интонация помогает тут слабее, чем кажется: в разговоре вопрос часто произносят без вопросительной интонации, а паузу делают не там, где кончилась мысль, а там, где человек подбирает слово.

Конвейер работает в одну сторону: каждый следующий шаг видит не голос, а результат предыдущего. Поэтому потерянное в начале не восстанавливается в конце.

Конвейер объясняет и то, почему бесполезно «прогнать через другой сервис» запись, у которой сломан первый шаг: на вход всем достанется один и тот же обеднённый файл.

Где на каждом шаге рождается своя ошибка

Теперь самое полезное — сопоставить шаги с тем, что видно в тексте. Строка в такой таблице означает не «плохое качество вообще», а конкретный симптом с конкретным адресом.

Тип ошибки указывает на шаг, а шаг — на способ лечения. Верхняя строка решается до записи, нижние — десятком правок после неё.

Проще всего это увидеть на одной фразе. Человек произнёс: «Шмидт пришлёт смету шестнадцатого, обсудим на рекламной кампании». В расшифровке может оказаться «Шмит пришлёт смету шестидесятого, обсудим на рекламной компании» — три ошибки из трёх разных мест. Фамилия сломалась на выборе слов: редкое имя проиграло привычному написанию. Число сломалось на звуках речи: различие в безударном слоге, а фраза одинаково подходит обоим вариантам. «Кампания» сломалась на языковой модели: два слова звучат одинаково, и подсказки хватило не на то. И ни одна из трёх не выглядит подозрительно.

Практический смысл такого разделения простой. Верхние строки — про запись: они решаются микрофоном, рассадкой и тишиной в комнате, а после того, как файл сделан, чинить там почти нечего. Нижние — про слова: они правятся вычиткой, причём не всего текста, а десятка мест. Пошаговый разбор симптомов и того, что чем лечится, — в отдельной статье о том, почему расшифровка получилась плохой.

До записи решаются потери звука, после — выбор слов. Второе чинится не сплошной вычиткой, а десятком мест: числами, фамилиями и названиями.

Омофоны: почему гладкая фраза бывает неверной

Русский язык устроен так, что разные слова сплошь и рядом звучат одинаково. Звонкие согласные на конце оглушаются, безударные гласные сближаются — и звуковая цепочка перестаёт однозначно указывать на слово.

  • Оглушение на конце. «Код» и «кот», «лук» и «луг», «плод» и «плот», «пруд» и «прут» — в речи различий нет вовсе.
  • Безударные гласные. «Компания» и «кампания», «старожил» и «сторожил», «примирять» и «примерять».
  • Стечения согласных. «Привести» и «привезти», «косный» и «костный», «бачок» и «бочок».
  • Имя или не имя. «Роман» и «роман», «надежда» и «Надежда», «вера» и «Вера»: звук один, а заглавная буква меняет смысл предложения.
Различить омофоны по звуку невозможно в принципе. Когда подсказки в соседних словах нет, выбор сводится к тому, какое слово встречается чаще.

Выбор делает контекст. Рядом со словом «рекламная» уверенно встанет «кампания», рядом с «наша» — «компания». Но контекст выручает, только когда он есть: в короткой реплике «да, привезти» опереться не на что, и результат становится делом вероятности.

Отдельная разновидность той же беды — границы слов. В потоке речи между словами нет пауз, и цепочка звуков режется на слова тем же способом, что и всё остальное: по правдоподобию. Отсюда «на встречу» вместо «навстречу», «по этому» вместо «поэтому» и слипшиеся в одно слово предлоги. На смысл это обычно не влияет, но в цитате, которую переносят в документ, такие места правят руками.

Числа, фамилии и термины — три вечных больных места

Три класса слов ошибаются чаще остальных, и ломаются все три по одной причине: короткое звучание плюс отсутствие поддержки со стороны контекста.

Что прозвучалоПочему трудноЧто помогает
Числа и даты«Шестнадцатого» и «шестидесятого» различаются безударным слогом, и фраза одинаково подходит обоимСверить по записи все суммы, даты и сроки — их в разговоре десяток
ФамилииРедкая фамилия проигрывает похожему обычному слову, которое встречается в языке несравнимо чащеПросить назвать по буквам, а в тексте править один раз и сразу по всему документу
Термины и аббревиатурыВ обычной речи почти не встречаются, а произносят их по-разному даже коллегиДоговориться о написании заранее и заменить поиском по тексту
Названия продуктовЧасто иноязычные: границы слов и место ударения непривычныПроговаривать полностью, а не сокращением; вычитывать список названий
Адреса и номера договоровДлинная цепочка коротких кусков: сбой в одном ломает всю цепочкуДиктовать медленно и продублировать письмом сразу после разговора

Отсюда правило, экономящее больше всего времени: доверие к расшифровке строится не на сплошной вычитке, а на проверке нескольких мест. Числа и имена собственные снабжены таймкодами, каждое проверяется кликом по строке, и после десяти кликов документу можно верить целиком. Что ещё влияет на результат — разобрано на странице про качество распознавания речи.

Плеер под расшифровкой: перемотка к отмеченной секунде для проверки числа или фамилии
Числа и имена собственные снабжены отметками времени, каждое проверяется кликом по строке. После десяти кликов документу можно верить целиком.

Наложение речи, шум и обрывы: чего вернуть нельзя

Отдельная группа ошибок приходит не от слов, а от того, что происходило в комнате во время записи.

Наложение речи. Когда двое говорят одновременно, звуки складываются физически: в одной дорожке оказывается их сумма, из которой отдельные голоса уже не вычитаются. Побеждает тот, кто громче и ближе, вторая реплика теряется или подмешивает в первую свои слова. Тот же участок ломает и разметку говорящих — отрезок с двумя голосами приходится отдать кому-то одному. Как устроена эта соседняя задача — в разборе что такое диаризация.

Это единственная беда из списка, которую после записи не лечит ничто: отдельные голоса из суммы уже не вычитаются, и тот же участок ломает разметку говорящих.

Ровный шум. Кондиционер, вытяжка, вентилятор ноутбука маскируют тихие части слов, прежде всего окончания. На встрече их не замечают, а на записи они присутствуют все шестьдесят минут.

Резкие звуки. Стук по столу, кашель, хлопнувшая дверь забивают короткое окно целиком: вместо звука речи там оказывается всплеск, и слово теряет опору.

Тишина и не-речь. На участках, где никто не говорил, текст всё равно иногда появляется: языковая модель умеет строить связную фразу, а звуковых оснований у неё почти нет. Поэтому гладкие предложения в самом начале записи, в конце и посреди долгой паузы стоит проверять по плееру, прежде чем переносить в документ.

Провалы записи. Обрыв связи, потерянные пакеты, перегруз — это не ошибка распознавания, а отсутствие материала. Восстанавливать там нечего, и честная пометка «неразборчиво» полезнее правдоподобной догадки, которая через месяц будет читаться как факт.

Откуда в расшифровке берутся запятые

Текст приходит с точками, запятыми и заглавными буквами, и это создаёт впечатление, будто система разбирает синтаксис вместе со звуком. На деле пунктуация — отдельный последний шаг, который работает уже с готовыми словами.

Обе задачи решаются по тексту, а не по звуку. Отсюда разнобой в записи чисел внутри одного документа и «надежда» со строчной там, где имелась в виду Надежда.

Отсюда узнаваемые особенности. Вопрос, произнесённый без вопросительной интонации — «то есть мы переносим» — приходит с точкой. Длинная фраза без пауз режется на предложения по грамматике, и границы иногда встают не там, где их поставил бы автор. Слова-паразиты остаются на месте: они были произнесены, значит, распознаны.

Тем же шагом решается, писать «шестнадцатого» словами или «16-го» цифрами и с какой буквы начинать слово, прозвучавшее как имя. Обе задачи решаются по тексту, а не по звуку: в звуке нет ни цифр, ни заглавных букв. Отсюда и разнобой в записи чисел внутри одного документа, и «надежда» со строчной буквы там, где имелась в виду Надежда.

Практический вывод: по пунктуации не судят о качестве распознавания — это разные вещи. А если из расшифровки берут прямую цитату в документ, знаки в ней всё равно поправят руками, как поправили бы в любой записи живой речи.

Что читатель может исправить сам — на записи

Половину перечисленного человек контролирует лично, но только до того, как нажата кнопка записи. Порядок — по убыванию отдачи.

  1. Сократите расстояние до микрофона. Полезный сигнал слабеет с расстоянием быстро, а эхо и фон остаются прежними. Гарнитура в тридцати сантиметрах даёт материал лучше, чем дорогой микрофон в трёх метрах.
  2. Уберите ровный фон. Кондиционер и вытяжку выключают на минуту, ноутбук отодвигают от микрофона. Это самое дешёвое улучшение из всех возможных.
  3. Попросите представиться в первую минуту. Имя, произнесённое вслух, и распознаётся, и подставляется в подписи говорящих. Имя, которое ни разу не прозвучало, взять неоткуда.
  4. Проговаривайте числа и фамилии отдельно. «Шестнадцатого сентября» в потоке речи звучит полсекунды. Названное чуть медленнее и повторённое один раз, оно даёт распознаванию вдвое больше материала.
  5. Договоритесь не перебивать. Наложение речи — единственная беда из этого списка, которая после записи не лечится ничем. Ведущий, передающий слово, экономит вечер вычитки.
  6. Загружайте оригинал файла. Копия, прошедшая через мессенджер, ужата ещё раз поверх исходного сжатия: часть признаков, по которым различаются звуки, теряется на ровном месте.
  1. Микрофонближе к говорящему, а не в центр стола
  2. Тишинаровный фон выключить до начала
  3. Порядокпредставились, стараются не перебивать
  4. Файлоригинал, а не пересланная копия

Чего исправить нельзя — это канала, если разговор шёл по телефону: верхняя часть спектра там отрезана до появления файла, и никакая последующая обработка её не вернёт. Общий порядок работы с записями — от диктофона до выгрузки из платформы для встреч — собран в гайде по расшифровке аудио и видео.

Как это выглядит в готовой расшифровке

Знание устройства цепочки полезно ровно одним: понятно, что и где проверять. В переводе речи в текст проверка устроена так, чтобы не перечитывать документ целиком.

Реплики расшифровки с временем каждой строки, найденное слово подсвечено в тексте
Перечитывать документ целиком не нужно. Фамилию или термин, которые распознались одинаково неверно, находят поиском и правят один раз — правка расходится по всем местам.

Термин или фамилию, которые распознались одинаково неверно во всех местах, исправляют один раз: правка расходится по всему тексту, и возвращаться к ней не приходится. Числа и даты проверяют по плееру — их в часовом разговоре обычно два-три десятка, и это единственная вычитка, которая действительно нужна.

Поверх расшифровки собирается короткий документ: итог, решения, задачи с владельцами и сроками. У выводов есть удобное свойство — они устойчивее к мелким огрехам, чем дословный текст: ошибка в одном слове редко меняет смысл решения.

Короткий пересказ записи: суть договорённостей и имена тех, кто их дал
Выводы устойчивее дословного текста: одно неверное слово редко меняет смысл решения. Поэтому короткий документ обычно надёжнее восьми страниц расшифровки.
Проверка за секундыКлик по строке проигрывает именно этот момент записи: спорное слово сверяется со звуком, а не с памятью.
Одна правка на весь текстФамилия и термин, распознанные одинаково неверно, исправляются один раз и меняются везде.
Выводы поверх словРешения и задачи собираются из смысла целых кусков, поэтому мелкие огрехи распознавания им не мешают.

Рядом с распознаванием работает вторая механика, у которой свои причины ошибок: кто и когда говорил определяется по звучанию голоса, а не по словам. Поэтому текст бывает верным при перепутанных подписях — и наоборот.

Посмотрите на своей записи

Загрузите файл — Vibe2Text вернёт текст с разделением говорящих и таймкодами, а поверх него соберёт итог разговора, решения и задачи с владельцами и сроками.

Перевести речь в текст

Бесплатный старт без карты, файлы до 4 ГБ и до 6 часов, русский и английский. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.

Частые вопросы

Как работает распознавание речи простыми словами?

Звук измеряют много тысяч раз в секунду и превращают в числа. Запись режут на окна в пару десятков миллисекунд и для каждого считают спектр — какие частоты в нём звучат. По спектру строятся гипотезы о звуках речи, а из гипотез собирается последовательность слов, которая и похожа на звук, и осмысленна как фраза. Последним шагом расставляются знаки препинания и заглавные буквы.

Что такое технология speech to text?

Английское название того же самого — перевод речи в текст. По-русски ту же вещь называют распознаванием речи, расшифровкой или транскрибацией: разница только в привычке говорящего. Задача одна — получить из аудио или видео текст, а если участников несколько, ещё и разложить реплики по говорящим.

Почему распознавание ошибается там, где человек всё понимает?

Человек знает тему разговора, помнит, о чём шла речь пять минут назад, и достраивает пропущенное по смыслу. Распознавание опирается на звук и на то, какие слова обычно ходят рядом. Там, где звука мало — короткое слово, наложение речи, шум, — оно подставляет самый вероятный вариант вместо пропуска. Поэтому ошибка выглядит гладко и не бросается в глаза.

Почему в расшифровке путаются похожие по звучанию слова?

Потому что они звучат одинаково: «код» и «кот», «компания» и «кампания», «привести» и «привезти». Различить их по звуку нельзя в принципе — выбор делает контекст. Когда соседние слова подсказки не дают, побеждает более частое слово, и фраза получается связной, но не о том.

Почему хуже всего распознаются числа, фамилии и термины?

У них две беды сразу. Они короткие — звука мало. И они редкие: при малейшей неуверенности похожее частое слово перевешивает. Отсюда рабочая привычка — сверять по записи не весь текст, а числа, даты, имена и названия: их в часовом разговоре обычно два-три десятка.

Качество записи влияет сильнее, чем выбор сервиса?

На первых шагах цепочки — да. Того, что не попало в файл, не восстановит никакая обработка: срезанный верх спектра, речь тише фона, наложенные голоса. Разные сервисы получают на вход один и тот же файл и упираются в одни и те же ограничения. Разница между ними видна на нормальной записи, а не на испорченной.

Можно ли добиться, чтобы наши термины писались правильно?

Практичный путь — не переучивать распознавание, а править результат: термин, распознанный одинаково неверно во всех местах, заменяется один раз и меняется по всему тексту. Помогает и сама запись: если название произнесли полностью и не скороговоркой, шансов у него заметно больше.

Проверено 13 августа 2026: связь частоты измерений сигнала и максимальной частоты, которую можно записать, — теорема Котельникова (Найквиста — Шеннона); параметры узкополосного телефонного канала (восемь тысяч измерений в секунду, полоса 300–3400 Гц) — стандарт ITU-T G.711; широкополосная передача речи с шестнадцатью тысячами измерений в секунду и полосой до 7 кГц — стандарты ITU-T G.722 и G.722.2; обработка речевого сигнала короткими кадрами по 10–20 мс — по кадровой структуре, описанной в ITU-T G.729 и G.722.2. Оглушение звонких согласных на конце слова и сближение безударных гласных, из которых берутся приведённые омофоны, — по разделу фонетики «Русской грамматики» (М.: Наука, 1980).