
РАЗБОР
Как работает распознавание речи: от звуковой волны до готового текста
Ошибки в расшифровке не случайны: у каждой свой шаг обработки. Показываем цепочку от звуковой волны до готового текста и то, что можно поправить самому — ещё на записи.
Ошибки в расшифровке не случайны
Час совещания, распознавание речи отработало за несколько минут, текст готов. Читаешь — и почти всё на месте, кроме четырёх мест: дата съехала на десяток лет, фамилия подрядчика превратилась в обычное слово, название продукта записано наугад, а минута, где заговорили втроём, слиплась в невнятный абзац.
Набор пострадавших мест почти всегда один и тот же — и это уже подсказка. Ошибки распознавания не рассыпаны по тексту случайно: каждая приходит с конкретного шага обработки. По виду ошибки почти всегда можно сказать, на каком шаге она родилась, и, что важнее, стоит ли с ней вообще бороться.
Пять шагов, из которых складывается распознавание речи
Ничего мистического в этой цепочке нет: она устроена как конвейер, где каждый следующий участок работает уже не с живым голосом, а с тем, что от него осталось после предыдущего.
Шаг 1. Воздух становится числами
Голос — это колебания давления воздуха. Микрофон превращает их в электрический сигнал, а запись измеряет этот сигнал много тысяч раз в секунду и сохраняет числа. Частота измерений задаёт потолок: чтобы звук какой-то частоты вообще попал в файл, измерять надо чаще, чем вдвое быстрее самой этой частоты. Это теорема Котельникова, и обойти её нечем.
Отсюда вся разница между записями. Обычный телефонный канал измеряет сигнал восемь тысяч раз в секунду и пропускает полосу примерно от 300 до 3400 герц — всё, что выше, отрезано ещё до того, как файл появился на свет. Широкополосная запись речи вдвое подробнее и сохраняет верхнюю часть спектра, где как раз и различаются шипящие. Ни один шаг дальше по конвейеру не вернёт того, чего в файле нет.
Шаг 2. Запись режется на короткие окна
Речь непрерывна, а разбирать её удобно кусками. Сигнал делят на окна длиной в пару десятков миллисекунд — примерно так же поступают речевые кодеки, которые работают кадрами по десять-двадцать миллисекунд. Длина выбрана не наугад: за такое время артикуляция почти не успевает измениться, то есть внутри окна звук можно считать однородным, а от окна к окну уже видно движение.
Шаг 3. Из окна получается спектр
Для каждого окна считают спектр — распределение энергии по частотам: где звук густой, где пустой. Так речь превращается из волны в картинку, на которой звуки речи различимы. Гласные дают устойчивые полосы энергии на своих местах, свистящие и шипящие — шум в верхней части спектра, взрывные — короткое смыкание и всплеск после него.
Здесь становится понятно, почему узкая полоса обходится так дорого. Разница между «с» и «ш» живёт наверху, за границей телефонного канала. Если этой части в файле нет, различать нечего: на месте выбора между похожими согласными остаётся догадка.
Шаг 4. Звуки складываются в слова
На этом шаге и живёт главное недоразумение: кажется, будто система «слышит слова». На самом деле она перебирает варианты. Для каждого отрезка есть несколько правдоподобных звуковых гипотез, и из них собирается такая последовательность слов, которая одновременно похожа на звук и осмысленна как русская фраза. За вторую половину отвечает языковая модель — представление о том, какие слова в языке бывают и какие из них обычно ходят друг за другом.
Из этого следуют два свойства, объясняющие почти все странности расшифровок. Первое: при равном звуке частое слово побеждает редкое. Второе: пустого места система почти не оставляет — если звука мало, она подставит то, что вероятнее. Поэтому ошибки читаются гладко: глаз о них не спотыкается, а факт в тексте уже неверный.
Шаг 5. Текст оформляется
Слова есть, а знаков препинания в устной речи не существует: в звуке нет ни точки, ни абзаца. Пунктуация и заглавные буквы расставляются последним шагом — уже по словам, по строению фразы и по паузам. Интонация помогает тут слабее, чем кажется: в разговоре вопрос часто произносят без вопросительной интонации, а паузу делают не там, где кончилась мысль, а там, где человек подбирает слово.
Конвейер объясняет и то, почему бесполезно «прогнать через другой сервис» запись, у которой сломан первый шаг: на вход всем достанется один и тот же обеднённый файл.
Где на каждом шаге рождается своя ошибка
Теперь самое полезное — сопоставить шаги с тем, что видно в тексте. Строка в такой таблице означает не «плохое качество вообще», а конкретный симптом с конкретным адресом.
Проще всего это увидеть на одной фразе. Человек произнёс: «Шмидт пришлёт смету шестнадцатого, обсудим на рекламной кампании». В расшифровке может оказаться «Шмит пришлёт смету шестидесятого, обсудим на рекламной компании» — три ошибки из трёх разных мест. Фамилия сломалась на выборе слов: редкое имя проиграло привычному написанию. Число сломалось на звуках речи: различие в безударном слоге, а фраза одинаково подходит обоим вариантам. «Кампания» сломалась на языковой модели: два слова звучат одинаково, и подсказки хватило не на то. И ни одна из трёх не выглядит подозрительно.
Практический смысл такого разделения простой. Верхние строки — про запись: они решаются микрофоном, рассадкой и тишиной в комнате, а после того, как файл сделан, чинить там почти нечего. Нижние — про слова: они правятся вычиткой, причём не всего текста, а десятка мест. Пошаговый разбор симптомов и того, что чем лечится, — в отдельной статье о том, почему расшифровка получилась плохой.
Омофоны: почему гладкая фраза бывает неверной
Русский язык устроен так, что разные слова сплошь и рядом звучат одинаково. Звонкие согласные на конце оглушаются, безударные гласные сближаются — и звуковая цепочка перестаёт однозначно указывать на слово.
- Оглушение на конце. «Код» и «кот», «лук» и «луг», «плод» и «плот», «пруд» и «прут» — в речи различий нет вовсе.
- Безударные гласные. «Компания» и «кампания», «старожил» и «сторожил», «примирять» и «примерять».
- Стечения согласных. «Привести» и «привезти», «косный» и «костный», «бачок» и «бочок».
- Имя или не имя. «Роман» и «роман», «надежда» и «Надежда», «вера» и «Вера»: звук один, а заглавная буква меняет смысл предложения.
Выбор делает контекст. Рядом со словом «рекламная» уверенно встанет «кампания», рядом с «наша» — «компания». Но контекст выручает, только когда он есть: в короткой реплике «да, привезти» опереться не на что, и результат становится делом вероятности.
Отдельная разновидность той же беды — границы слов. В потоке речи между словами нет пауз, и цепочка звуков режется на слова тем же способом, что и всё остальное: по правдоподобию. Отсюда «на встречу» вместо «навстречу», «по этому» вместо «поэтому» и слипшиеся в одно слово предлоги. На смысл это обычно не влияет, но в цитате, которую переносят в документ, такие места правят руками.
Числа, фамилии и термины — три вечных больных места
Три класса слов ошибаются чаще остальных, и ломаются все три по одной причине: короткое звучание плюс отсутствие поддержки со стороны контекста.
| Что прозвучало | Почему трудно | Что помогает |
|---|---|---|
| Числа и даты | «Шестнадцатого» и «шестидесятого» различаются безударным слогом, и фраза одинаково подходит обоим | Сверить по записи все суммы, даты и сроки — их в разговоре десяток |
| Фамилии | Редкая фамилия проигрывает похожему обычному слову, которое встречается в языке несравнимо чаще | Просить назвать по буквам, а в тексте править один раз и сразу по всему документу |
| Термины и аббревиатуры | В обычной речи почти не встречаются, а произносят их по-разному даже коллеги | Договориться о написании заранее и заменить поиском по тексту |
| Названия продуктов | Часто иноязычные: границы слов и место ударения непривычны | Проговаривать полностью, а не сокращением; вычитывать список названий |
| Адреса и номера договоров | Длинная цепочка коротких кусков: сбой в одном ломает всю цепочку | Диктовать медленно и продублировать письмом сразу после разговора |
Отсюда правило, экономящее больше всего времени: доверие к расшифровке строится не на сплошной вычитке, а на проверке нескольких мест. Числа и имена собственные снабжены таймкодами, каждое проверяется кликом по строке, и после десяти кликов документу можно верить целиком. Что ещё влияет на результат — разобрано на странице про качество распознавания речи.

Наложение речи, шум и обрывы: чего вернуть нельзя
Отдельная группа ошибок приходит не от слов, а от того, что происходило в комнате во время записи.
Наложение речи. Когда двое говорят одновременно, звуки складываются физически: в одной дорожке оказывается их сумма, из которой отдельные голоса уже не вычитаются. Побеждает тот, кто громче и ближе, вторая реплика теряется или подмешивает в первую свои слова. Тот же участок ломает и разметку говорящих — отрезок с двумя голосами приходится отдать кому-то одному. Как устроена эта соседняя задача — в разборе что такое диаризация.
Ровный шум. Кондиционер, вытяжка, вентилятор ноутбука маскируют тихие части слов, прежде всего окончания. На встрече их не замечают, а на записи они присутствуют все шестьдесят минут.
Резкие звуки. Стук по столу, кашель, хлопнувшая дверь забивают короткое окно целиком: вместо звука речи там оказывается всплеск, и слово теряет опору.
Тишина и не-речь. На участках, где никто не говорил, текст всё равно иногда появляется: языковая модель умеет строить связную фразу, а звуковых оснований у неё почти нет. Поэтому гладкие предложения в самом начале записи, в конце и посреди долгой паузы стоит проверять по плееру, прежде чем переносить в документ.
Провалы записи. Обрыв связи, потерянные пакеты, перегруз — это не ошибка распознавания, а отсутствие материала. Восстанавливать там нечего, и честная пометка «неразборчиво» полезнее правдоподобной догадки, которая через месяц будет читаться как факт.
Откуда в расшифровке берутся запятые
Текст приходит с точками, запятыми и заглавными буквами, и это создаёт впечатление, будто система разбирает синтаксис вместе со звуком. На деле пунктуация — отдельный последний шаг, который работает уже с готовыми словами.
Отсюда узнаваемые особенности. Вопрос, произнесённый без вопросительной интонации — «то есть мы переносим» — приходит с точкой. Длинная фраза без пауз режется на предложения по грамматике, и границы иногда встают не там, где их поставил бы автор. Слова-паразиты остаются на месте: они были произнесены, значит, распознаны.
Тем же шагом решается, писать «шестнадцатого» словами или «16-го» цифрами и с какой буквы начинать слово, прозвучавшее как имя. Обе задачи решаются по тексту, а не по звуку: в звуке нет ни цифр, ни заглавных букв. Отсюда и разнобой в записи чисел внутри одного документа, и «надежда» со строчной буквы там, где имелась в виду Надежда.
Практический вывод: по пунктуации не судят о качестве распознавания — это разные вещи. А если из расшифровки берут прямую цитату в документ, знаки в ней всё равно поправят руками, как поправили бы в любой записи живой речи.
Что читатель может исправить сам — на записи
Половину перечисленного человек контролирует лично, но только до того, как нажата кнопка записи. Порядок — по убыванию отдачи.
- Сократите расстояние до микрофона. Полезный сигнал слабеет с расстоянием быстро, а эхо и фон остаются прежними. Гарнитура в тридцати сантиметрах даёт материал лучше, чем дорогой микрофон в трёх метрах.
- Уберите ровный фон. Кондиционер и вытяжку выключают на минуту, ноутбук отодвигают от микрофона. Это самое дешёвое улучшение из всех возможных.
- Попросите представиться в первую минуту. Имя, произнесённое вслух, и распознаётся, и подставляется в подписи говорящих. Имя, которое ни разу не прозвучало, взять неоткуда.
- Проговаривайте числа и фамилии отдельно. «Шестнадцатого сентября» в потоке речи звучит полсекунды. Названное чуть медленнее и повторённое один раз, оно даёт распознаванию вдвое больше материала.
- Договоритесь не перебивать. Наложение речи — единственная беда из этого списка, которая после записи не лечится ничем. Ведущий, передающий слово, экономит вечер вычитки.
- Загружайте оригинал файла. Копия, прошедшая через мессенджер, ужата ещё раз поверх исходного сжатия: часть признаков, по которым различаются звуки, теряется на ровном месте.
- Микрофонближе к говорящему, а не в центр стола
- Тишинаровный фон выключить до начала
- Порядокпредставились, стараются не перебивать
- Файлоригинал, а не пересланная копия
Чего исправить нельзя — это канала, если разговор шёл по телефону: верхняя часть спектра там отрезана до появления файла, и никакая последующая обработка её не вернёт. Общий порядок работы с записями — от диктофона до выгрузки из платформы для встреч — собран в гайде по расшифровке аудио и видео.
Как это выглядит в готовой расшифровке
Знание устройства цепочки полезно ровно одним: понятно, что и где проверять. В переводе речи в текст проверка устроена так, чтобы не перечитывать документ целиком.

Термин или фамилию, которые распознались одинаково неверно во всех местах, исправляют один раз: правка расходится по всему тексту, и возвращаться к ней не приходится. Числа и даты проверяют по плееру — их в часовом разговоре обычно два-три десятка, и это единственная вычитка, которая действительно нужна.
Поверх расшифровки собирается короткий документ: итог, решения, задачи с владельцами и сроками. У выводов есть удобное свойство — они устойчивее к мелким огрехам, чем дословный текст: ошибка в одном слове редко меняет смысл решения.

Рядом с распознаванием работает вторая механика, у которой свои причины ошибок: кто и когда говорил определяется по звучанию голоса, а не по словам. Поэтому текст бывает верным при перепутанных подписях — и наоборот.
Посмотрите на своей записи
Загрузите файл — Vibe2Text вернёт текст с разделением говорящих и таймкодами, а поверх него соберёт итог разговора, решения и задачи с владельцами и сроками.
Перевести речь в текстБесплатный старт без карты, файлы до 4 ГБ и до 6 часов, русский и английский. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.
Частые вопросы
Как работает распознавание речи простыми словами?
Звук измеряют много тысяч раз в секунду и превращают в числа. Запись режут на окна в пару десятков миллисекунд и для каждого считают спектр — какие частоты в нём звучат. По спектру строятся гипотезы о звуках речи, а из гипотез собирается последовательность слов, которая и похожа на звук, и осмысленна как фраза. Последним шагом расставляются знаки препинания и заглавные буквы.
Что такое технология speech to text?
Английское название того же самого — перевод речи в текст. По-русски ту же вещь называют распознаванием речи, расшифровкой или транскрибацией: разница только в привычке говорящего. Задача одна — получить из аудио или видео текст, а если участников несколько, ещё и разложить реплики по говорящим.
Почему распознавание ошибается там, где человек всё понимает?
Человек знает тему разговора, помнит, о чём шла речь пять минут назад, и достраивает пропущенное по смыслу. Распознавание опирается на звук и на то, какие слова обычно ходят рядом. Там, где звука мало — короткое слово, наложение речи, шум, — оно подставляет самый вероятный вариант вместо пропуска. Поэтому ошибка выглядит гладко и не бросается в глаза.
Почему в расшифровке путаются похожие по звучанию слова?
Потому что они звучат одинаково: «код» и «кот», «компания» и «кампания», «привести» и «привезти». Различить их по звуку нельзя в принципе — выбор делает контекст. Когда соседние слова подсказки не дают, побеждает более частое слово, и фраза получается связной, но не о том.
Почему хуже всего распознаются числа, фамилии и термины?
У них две беды сразу. Они короткие — звука мало. И они редкие: при малейшей неуверенности похожее частое слово перевешивает. Отсюда рабочая привычка — сверять по записи не весь текст, а числа, даты, имена и названия: их в часовом разговоре обычно два-три десятка.
Качество записи влияет сильнее, чем выбор сервиса?
На первых шагах цепочки — да. Того, что не попало в файл, не восстановит никакая обработка: срезанный верх спектра, речь тише фона, наложенные голоса. Разные сервисы получают на вход один и тот же файл и упираются в одни и те же ограничения. Разница между ними видна на нормальной записи, а не на испорченной.
Можно ли добиться, чтобы наши термины писались правильно?
Практичный путь — не переучивать распознавание, а править результат: термин, распознанный одинаково неверно во всех местах, заменяется один раз и меняется по всему тексту. Помогает и сама запись: если название произнесли полностью и не скороговоркой, шансов у него заметно больше.
Проверено 13 августа 2026: связь частоты измерений сигнала и максимальной частоты, которую можно записать, — теорема Котельникова (Найквиста — Шеннона); параметры узкополосного телефонного канала (восемь тысяч измерений в секунду, полоса 300–3400 Гц) — стандарт ITU-T G.711; широкополосная передача речи с шестнадцатью тысячами измерений в секунду и полосой до 7 кГц — стандарты ITU-T G.722 и G.722.2; обработка речевого сигнала короткими кадрами по 10–20 мс — по кадровой структуре, описанной в ITU-T G.729 и G.722.2. Оглушение звонких согласных на конце слова и сближение безударных гласных, из которых берутся приведённые омофоны, — по разделу фонетики «Русской грамматики» (М.: Наука, 1980).