
РАЗБОР
Расшифровка получилась плохой: как понять, виноват звук или сервис
Текст пришёл, а пользоваться им нельзя: куски пропали, фамилии переврали, двое слиплись в одного. Диагностика одного фрагмента за 5 минут покажет, что ещё чинится.
«Плохая расшифровка» — это шесть разных поломок
Час разговора, файл загружен, текст пришёл — и расшифровка получилась плохой. Дальше обычно принимают одно из двух решений, и оба поспешные: либо «сервис слабый, попробуем другой», либо «звук был так себе, ничего не поделаешь». Первое стоит вечера и четырёх одинаково плохих текстов: выбирать сервис имеет смысл по семи признакам, а не по одной неудачной записи. Второе — записи, из которой можно было вытащить всё нужное за десять минут.
Разбираться стоит с другого конца. «Много ошибок» — это не диагноз, а жалоба. Диагноз звучит иначе: «пропадают куски по 5–10 секунд там, где говорят двое», или «фамилии всегда неверные, а остальное точное». Разные симптомы указывают на разные места, где всё сломалось: на микрофон, на условия разговора, на сам файл или на редкие слова, которых в разговоре было слишком много.
Вот шесть симптомов, которые встречаются чаще всего. Почти любая неудачная расшифровка — это один или два из них, а не «всё плохо».
- Слиплись спикеры. Двое разных людей идут в тексте под одной подписью — или, наоборот, говорящих оказывается больше, чем было в комнате.
- Пропали куски. Фраза начинается и обрывается, дальше пусто, потом текст продолжается как ни в чём не бывало.
- Каша в терминах. Обычная речь распознана нормально, но названия, аббревиатуры и профессиональный жаргон превращаются в похожие по звучанию бытовые слова.
- Неверные числа и фамилии. Смысл на месте, но «шестнадцатого» стало «шестидесятым», а Шмидт — Шмитом. Самое опасное, потому что выглядит правдоподобно.
- Текст обрывается. Расшифровка заканчивается на сороковой минуте часовой записи, дальше ничего.
- Текст на пустом месте. На участке, где никто не говорил, появилась гладкая фраза, которой в разговоре не было.

Первые два и последний — почти всегда про запись. Третий и четвёртый — про слова, которые в ней прозвучали. Пятый вообще не про распознавание, а про файл.
Диагностика за 5 минут: один фрагмент, три вопроса
Главный приём: не оценивайте текст целиком. Возьмите один фрагмент на две-три минуты — тот, где ошибок больше всего, — и работайте только с ним. Всё, что нужно понять про качество часовой записи, видно на этих трёх минутах, а времени они отнимают в двадцать раз меньше.
- Послушайте фрагмент сами, в наушниках, глядя в текст. Отмечайте не ошибки сервиса, а слова, которых вы сами не разбираете. Человек здесь сильнее любой автоматики: он знает тему и достраивает пропущенное. Если вы не понимаете половину — распознавать там нечего.
- Сравните два места записи. Возьмите кусок, где один человек говорит спокойно и близко к микрофону, и кусок, где заговорили разом или кто-то отвечал из глубины комнаты. Ровный текст в первом и каша во втором означают, что инструмент работает, а условия — нет.
- Посмотрите, повторяется ли ошибка. Незнакомое слово, искажённое одинаково в каждом появлении, — не сбой, а промашка на редкой лексике: чинится одной заменой. Разные ошибки, разбросанные ровно по тексту, — дело в сигнале.
- Совместите дырки с записью по таймкодам. Откройте два-три места, где текст пропал, и послушайте именно их. Обычно там обнаруживается что-то предметное: скрип двери, кашель в микрофон, чужой разговор, музыкальная заставка или просто пауза.
- Проверьте, что загрузили оригинал. Файл, прошедший через мессенджер или почтовый лимит, ужат ещё раз поверх исходного сжатия. Самая обидная из причин: оригинал лежал в двух кликах, а расшифровывали копию.
Запись: ______________________ Длительность: ___ мин Вес файла: ___ МБ Фрагмент для разбора: с 00:__:__ по 00:__:__ (2–3 минуты с самыми грубыми ошибками) 1. Я сам разбираю речь в этом фрагменте на слух? да / нет / частично 2. Ошибки собраны в одном месте или размазаны по всему тексту? кучкуются / ровно 3. Одно и то же слово искажается одинаково каждый раз? да / нет 4. Что слышно на таймкодах, где текст пропал: _______________________ 5. Вес файла у источника: ___ МБ. Совпадает с моим? да / нет Вывод (нужное оставить): дело в записи — новый файл или пометка «неразборчиво» дело в редких словах — замена по всему тексту, список: ______________ дело в спикерах — переназначить подписи по таймкодам дело в файле — перезалить оригинал, а не пересланную копию
Заполняется по одному фрагменту, а не по всей записи: на 60 минутах вычитки терпение кончается раньше, чем находится причина. Пункт 5 закрывает самый обидный случай — расшифровку копии копии.
Дерево: симптом → причина → что делать
Когда фрагмент разобран, поломка обычно называется точно. Дальше работает простое дерево: у каждого симптома одна-две типовые причины, и для каждой есть понятное действие — либо правка за минуту, либо прямое «это не восстановится».
Та же логика подробнее — по каждому из шести симптомов, с проверкой, которая занимает меньше минуты.
| Симптом в тексте | Обычная причина | Проверка за минуту | Что делать |
|---|---|---|---|
| Спикеры слиплись | Похожие голоса, наложение речи, общий микрофон | Послушать спорную минуту: разные ли это люди | Переназначить подписи по таймкодам |
| Пропали куски | Провал в записи: перегруз, обрыв связи, речь тише фона | Совместить пропуск с записью по таймкоду | Пометить «неразборчиво» |
| Каша в терминах | Редкая лексика: жаргон, названия, аббревиатуры | Слово искажается одинаково в каждом появлении | Одна замена по всему тексту |
| Неверные числа и фамилии | Короткое слово, мало сигнала, нет подсказки контекста | Выписать числа и имена, сверить по плееру | Править, сверяясь с записью |
| Текст обрывается | Файл короче, чем кажется, или повреждён | Открыть исходник и досмотреть до конца | Перезалить оригинал, а не пересланную копию |
| Фразы из ниоткуда | Участок без речи: пауза, музыка, ровный шум | Послушать этот таймкод — слов там нет | Удалить кусок, а запись впредь обрезать |
Как выглядит проблемный звук
Формулировка «плохой звук» слишком общая: плохим он бывает пятью разными способами, и последствия у них разные. Полезно один раз посмотреть на запись глазами — в любом плеере с дорожкой видно то, что на слух проскакивает мимо.
Перегруз — самая необратимая история. Если при записи встречи микрофон стоял слишком близко или уровень записи выкрутили в потолок, пики волны упираются в предел и срезаются. Срезанную верхушку не вернуть ничем: этих значений в файле физически нет, а на слух получается хрип, в котором согласные не различаются. Увидеть перегруз можно до загрузки — по сплошной «колбасе» на дорожке.
Дистанция и эхо работают тише, но портят не меньше. Отодвиньте микрофон вдвое дальше — полезный сигнал заметно ослабнет, а количество отражений от стен, стекла и стола останется прежним. В переговорке с голыми поверхностями голос с дальнего конца стола приходит вместе со своей копией, запаздывающей на доли секунды. Человек такое эхо мысленно вычитает и почти его не замечает, автоматика — нет.
Наложение речи — отдельный класс сложности, и это измеряют открытыми испытаниями. В публичных соревнованиях по распознаванию застольного разговора — микрофоны расставлены по комнате, люди перебивают друг друга, в фоне посуда и телевизор — доля ошибочных слов у сильнейших команд остаётся двузначной, тогда как на чистой речи распознавание почти безошибочно. Практический вывод один: трое, говорящие разом из разных углов комнаты, лечатся не сменой сервиса, а отдельными микрофонами и просьбой не перебивать. Почему наложение речи ломается именно так, видно из того, как работает распознавание речи.
Почему система ошибается там, где человек понимает
Распознавание речи — это не чтение и не «прослушивание». Это выбор самой правдоподобной последовательности слов при данном звуке. Отсюда три следствия, которые объясняют почти все странности в расшифровках.
- Где мало сигнала, появляется догадка. Система редко оставляет пустое место: она подставляет то, что вероятнее. Поэтому ошибки читаются гладко — на них не спотыкаешься глазом, и это опаснее откровенной абракадабры.
- Редкое слово проигрывает частому. Фамилия, название продукта, внутренняя аббревиатура встречаются в языке несравнимо реже похожего бытового слова — и проигрывают ему при любой неуверенности в звуке. Отсюда и стабильность ошибки: она закономерна.
- Контекст помогает, но не всегда. Длинную фразу вытягивает окружение: соседние слова подсказывают, что было сказано. Короткое число или имя такой поддержки лишено — потому цифры и фамилии страдают чаще всего.
Отсюда же берутся фразы на пустом месте. На участках, где речи не было — тишина, музыкальная заставка, ровный шум, — система всё равно может выдать связный текст. Эффект известный, его отдельно изучают в открытых работах: не-речевой звук порождает устойчивые ложные вставки, причём одни и те же от записи к записи. Вывод: подозрительно гладкую фразу в начале, в конце или посреди паузы проверяйте по записи, прежде чем переносить в документ.
Отдельная история — записи, прошедшие через телефонную линию: часть звуковой информации там теряется ещё до того, как файл вообще появился, и вернуть её невозможно ничем. Классический телефонный канал передаёт полосу примерно 300–3 400 Гц, тогда как обычная запись на 16 кГц дискретизации доносит до 8 000 Гц — вдвое больше по верхней границе. Отрезается там как раз верх, где различаются шипящие и свистящие: «с», «ф», «ш» звучат почти одинаково, и текст начинает путать похожие слова. Для диагностики важно ровно одно: такие ошибки не лечатся сменой сервиса, потому что все сервисы получают на вход один и тот же обеднённый сигнал.
Второе место, где сигнал беднеет уже по вашей вине, — пересылка. Вес считается в одно действие: битрейт умножить на длительность и разделить на 8. Запись 64 кбит/с длиной 3 600 секунд даёт около 28 МБ; она же, ужатая мессенджером до 16 кбит/с, весит примерно 7 МБ — 75 % данных выброшено, причём выброшено повторно, поверх исходного сжатия. Отсюда правило, которое экономит вечер: сравните вес файла у себя и вес оригинала в источнике. Разница в 3–4 раза означает, что вы расшифровываете копию копии, а оригинал лежит в двух кликах.
Из всего этого следует главное правило доверия к расшифровке: сверяют не весь текст, а числа и имена собственные. В часовом разговоре их обычно два-три десятка, у каждого стоит таймкод, и полчаса подозрений закрываются пятью минутами кликов по плееру. Что именно влияет на результат и на чём качество теряется сильнее всего — разобрано отдельно: качество распознавания речи.
Что чинится за минуту, а что не чинится вовсе
После диагностики список дел короткий, и он делится на три части: что закрывается правкой, что — повторной загрузкой, а что не закрывается ничем.
Первая группа — точечная вычитка: править приходится не текст целиком, а отдельные слова, и делается это по таймкодам — клик по строке проигрывает именно этот момент записи, так что одна правка занимает секунды. Вторая обиднее всего: человек меняет сервис, хотя достаточно было взять исходный файл. Третья — повод не тратить вечер, а признать, что запись не удалась.
- Не переписывайте текст целиком. Правьте то, на что будете ссылаться: решения, суммы, сроки, имена. Остальное можно оставить как есть — на понимание это не влияет.
- Не додумывайте пропуски. Пометка «неразборчиво» честнее правдоподобной догадки, а через месяц именно эта разница окажется важной.
- Не «улучшайте» звук после того, как текст уже неровный. Агрессивная чистка выедает окончания слов вместе с шумом, и ошибок обычно становится больше, а не меньше.
Как вытащить пользу из уже неровного текста
Даже посредственная расшифровка обычно содержит всё, ради чего затевалась. Искать в ней нужно иначе: не читать подряд, а идти по структуре разговора и по спорным точкам.

- Начните с конца. Договорённости почти всегда в последней трети разговора. Найдите в тексте «давайте тогда», «итого», «до какого числа» — и слушайте только эти минуты.
- Выпишите числа и имена отдельным списком. Суммы, даты, сроки, фамилии, номера договоров. Каждое проверяется по плееру за секунды, и после этого документу можно доверять.
- Спорное слушайте на замедленной скорости. Скорость 0,75 вытаскивает окончания и разницу между «шестнадцатого» и «шестидесятого» надёжнее любой обработки звука.
- Переименуйте говорящих один раз. «Спикер 2» → Клиент: подпись меняется сразу по всему диалогу, и текст становится читаемым без дополнительной вычитки.
- Соберите поверх текста сводку. Итог, решения и задачи устойчивее к мелким огрехам, чем дословная стенограмма: ошибка в одном слове редко меняет смысл решения.
- Непонятное спрашивайте, а не ищите. Вопрос по записи возвращается с прямой цитатой и отметкой времени — её можно тут же переслушать и убедиться самому.

Когда текст неровный, короткий документ поверх него полезнее самой расшифровки: решения и задачи с именами и сроками собираются из смысловых кусков, а не из каждого слова. Проверять там нужно немного — те же числа и фамилии, и каждый пункт снабжён ссылкой на секунду, где это прозвучало. От чего зависит итоговое качество расшифровки, полезно понимать заранее.

Слипшихся говорящих правят там же: спорные куски находятся по таймкодам и переназначаются вручную, а имена сервис по возможности подставляет из самого разговора — если участники представились в начале. Подробнее о том, как это устроено и где ошибается: разделение спикеров.
Как записать так, чтобы диагностика не понадобилась
Все перечисленные проблемы решаются в одном месте — на записи, и стоят там копейки времени. 20 секунд проверки перед стартом экономят вечер вычитки.
- Микрофонближе к говорящему, не в центр стола
- Уровеньпроба 20 секунд, пики не в потолок
- Разговорпредставились, стараются не перебивать
- Файлоригинал, а не пересланная копия
- Дистанция важнее цены микрофона. Дешёвая гарнитура в 30 сантиметрах даёт результат лучше, чем дорогой микрофон в 3 метрах. Если участников несколько, лучше несколько источников звука, чем один «на всех».
- Сделайте пробу. 20 секунд, прослушать, посмотреть на дорожку. Единственный способ поймать выкрученный уровень или не тот вход до, а не после разговора.
- Просите представляться в начале. Одна фраза «Ирина, продукт» на старте — и подписи в расшифровке появятся сами, без ручного переименования.
- Отдельные дорожки, если платформа умеет. Когда каждый участник пишется в свой канал, наложение речи перестаёт быть проблемой в принципе.
- Уберите ровный фон. Кондиционер, вытяжка, вентилятор ноутбука: их не замечают на встрече, но на записи они присутствуют все 60 минут.
- Забирайте оригинал. Скачивайте файл из источника, а не пересылайте его через мессенджер: каждое пересжатие отнимает у распознавания часть признаков.
Про то, какой формат аудио лучше для расшифровки, и способы получить исходник — от диктофона до выгрузки из платформы для встреч — есть отдельный разбор: гайд по расшифровке аудио и видео. Если запись ещё предстоит, полчаса на подготовку окупаются на первом же файле. А когда файл уже на руках, отдельный вопрос — что с ним имеет смысл сделать до загрузки, а что только испортит текст.
Проверьте на сложном фрагменте, а не на простом
Возьмите те самые три минуты, где текст рассыпался, и загрузите их в Vibe2Text: расшифровка придёт с разделением говорящих и таймкодами, а поверх неё соберётся сводка с решениями и задачами.
Проверить качество на своей записиБесплатный старт без карты, файлы до 4 ГБ и до 6 часов. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.
Частые вопросы
Плохая расшифровка — что делать в первую очередь?
Не перезагружать файл в другой сервис, а взять фрагмент на две-три минуты и послушать его в наушниках, глядя в текст. Если вы сами не разбираете половину слов — проблема в записи, и сменой инструмента она не решается. Если разбираете, смотрите, где ошибки кучкуются: на наложении речи, на редких словах или ровно по тексту.
Почему нейросеть плохо распознаёт речь, хотя человек всё понимает?
Человек знает тему, помнит контекст и достраивает пропущенное по смыслу — фактически он слышит не только звук. Автоматика выбирает самую вероятную последовательность слов по имеющемуся сигналу, и там, где сигнала мало, вместо честного пропуска подставляет догадку. Поэтому ошибки читаются гладко.
Много ошибок в транскрибации — поможет ли другой сервис?
Иногда да, но проверять стоит на одном трудном фрагменте, а не на всей записи. Если оба текста разваливаются в одних и тех же местах — там, где говорили разом или издалека, — дело в записи: любой инструмент получит тот же звук. Если один справляется и с чистыми участками, а другой нет, разница есть.
В расшифровке появились фразы, которых точно не было. Откуда они?
Так проявляются участки без речи: пауза, музыкальная заставка, ровный фоновый шум. На них система может выдать связный текст, и такие вставки нередко повторяются от записи к записи — эффект описан в открытых исследованиях. Проверяйте гладкие фразы в начале, в конце и в местах тишины по таймкоду, а в следующий раз обрезайте вступительную музыку и длинные паузы.
Сервис слепил двух человек в одного спикера — это можно исправить?
Да, вручную и довольно быстро: спорные куски находятся по таймкодам и переназначаются, подпись меняется сразу по всему диалогу. Голоса слипаются, когда тембры близкие, люди перебивают друг друга или говорят в общий микрофон. Обратная ошибка — говорящих больше, чем людей в комнате — обычно значит, что метку получил голос из коридора.
Стоит ли чистить запись шумодавом перед загрузкой?
Как правило, нет. Бытовая чистка настроена на то, чтобы запись приятнее звучала, и вместе с шумом снимает окончания слов и признаки согласных, по которым различается речь. Распознаванию обычно проще с честным шумным сигналом. Пробуете — сравните оба варианта на одном фрагменте.
Текст обрывается на середине записи — это ошибка сервиса?
Чаще всего нет: обрывается сам файл. Откройте исходник и промотайте в конец — нередко выясняется, что запись остановилась раньше разговора или повредилась при выгрузке. Второй частый случай — урезанная копия, прошедшая через мессенджер. Проверяется за минуту, решается загрузкой оригинала.
Проверено 13 августа 2026. Сложность распознавания разговора нескольких человек, записанного удалёнными микрофонами в жилом помещении, — по постановке задачи и данным открытого испытания CHiME-5 (arXiv:1803.10609) и обзору его продолжения CHiME-6, где доля ошибочных слов у сильнейших систем остаётся двузначной. Ложный текст, который распознавание порождает на не-речевых фрагментах, — по исследованию arXiv:2501.11378 (январь 2025): устойчивые повторяющиеся вставки на шуме, музыке и тишине. Полоса классического телефонного канала (примерно 300–3 400 Гц) — по рекомендации ITU-T G.712, задающей характеристики передачи узкополосного речевого тракта; верхняя граница обычной записи выводится из частоты дискретизации по теореме Котельникова (16 кГц дискретизации — до 8 000 Гц). Вес файла считается арифметикой, приведённой в тексте: битрейт × длительность ÷ 8 (64 кбит/с × 3 600 с ≈ 28 МБ, 16 кбит/с ≈ 7 МБ). Утверждения о срезанных при перегрузе пиках и о потере полезного сигнала с расстоянием — из базовых свойств цифровой записи и акустики помещения.