Расшифровка получилась плохой: как понять, виноват звук или сервис

РАЗБОР

Расшифровка получилась плохой: как понять, виноват звук или сервис

Текст пришёл, а пользоваться им нельзя: куски пропали, фамилии переврали, двое слиплись в одного. Диагностика одного фрагмента за 5 минут покажет, что ещё чинится.

«Плохая расшифровка» — это шесть разных поломок

Час разговора, файл загружен, текст пришёл — и расшифровка получилась плохой. Дальше обычно принимают одно из двух решений, и оба поспешные: либо «сервис слабый, попробуем другой», либо «звук был так себе, ничего не поделаешь». Первое стоит вечера и четырёх одинаково плохих текстов: выбирать сервис имеет смысл по семи признакам, а не по одной неудачной записи. Второе — записи, из которой можно было вытащить всё нужное за десять минут.

Разбираться стоит с другого конца. «Много ошибок» — это не диагноз, а жалоба. Диагноз звучит иначе: «пропадают куски по 5–10 секунд там, где говорят двое», или «фамилии всегда неверные, а остальное точное». Разные симптомы указывают на разные места, где всё сломалось: на микрофон, на условия разговора, на сам файл или на редкие слова, которых в разговоре было слишком много.

Вот шесть симптомов, которые встречаются чаще всего. Почти любая неудачная расшифровка — это один или два из них, а не «всё плохо».

  • Слиплись спикеры. Двое разных людей идут в тексте под одной подписью — или, наоборот, говорящих оказывается больше, чем было в комнате.
  • Пропали куски. Фраза начинается и обрывается, дальше пусто, потом текст продолжается как ни в чём не бывало.
  • Каша в терминах. Обычная речь распознана нормально, но названия, аббревиатуры и профессиональный жаргон превращаются в похожие по звучанию бытовые слова.
  • Неверные числа и фамилии. Смысл на месте, но «шестнадцатого» стало «шестидесятым», а Шмидт — Шмитом. Самое опасное, потому что выглядит правдоподобно.
  • Текст обрывается. Расшифровка заканчивается на сороковой минуте часовой записи, дальше ничего.
  • Текст на пустом месте. На участке, где никто не говорил, появилась гладкая фраза, которой в разговоре не было.
Реплики расшифровки: у каждой указан говорящий и интервал времени
Исправная расшифровка выглядит так: у каждой фразы есть автор и время. Ломается почти всегда одно из этих двух.

Первые два и последний — почти всегда про запись. Третий и четвёртый — про слова, которые в ней прозвучали. Пятый вообще не про распознавание, а про файл.

Диагностика за 5 минут: один фрагмент, три вопроса

Главный приём: не оценивайте текст целиком. Возьмите один фрагмент на две-три минуты — тот, где ошибок больше всего, — и работайте только с ним. Всё, что нужно понять про качество часовой записи, видно на этих трёх минутах, а времени они отнимают в двадцать раз меньше.

  1. Послушайте фрагмент сами, в наушниках, глядя в текст. Отмечайте не ошибки сервиса, а слова, которых вы сами не разбираете. Человек здесь сильнее любой автоматики: он знает тему и достраивает пропущенное. Если вы не понимаете половину — распознавать там нечего.
  2. Сравните два места записи. Возьмите кусок, где один человек говорит спокойно и близко к микрофону, и кусок, где заговорили разом или кто-то отвечал из глубины комнаты. Ровный текст в первом и каша во втором означают, что инструмент работает, а условия — нет.
  3. Посмотрите, повторяется ли ошибка. Незнакомое слово, искажённое одинаково в каждом появлении, — не сбой, а промашка на редкой лексике: чинится одной заменой. Разные ошибки, разбросанные ровно по тексту, — дело в сигнале.
  4. Совместите дырки с записью по таймкодам. Откройте два-три места, где текст пропал, и послушайте именно их. Обычно там обнаруживается что-то предметное: скрип двери, кашель в микрофон, чужой разговор, музыкальная заставка или просто пауза.
  5. Проверьте, что загрузили оригинал. Файл, прошедший через мессенджер или почтовый лимит, ужат ещё раз поверх исходного сжатия. Самая обидная из причин: оригинал лежал в двух кликах, а расшифровывали копию.
Протокол диагностики: один фрагмент, 5 минут
Запись: ______________________  Длительность: ___ мин  Вес файла: ___ МБ
Фрагмент для разбора: с 00:__:__ по 00:__:__ (2–3 минуты с самыми грубыми ошибками)

1. Я сам разбираю речь в этом фрагменте на слух?   да / нет / частично
2. Ошибки собраны в одном месте или размазаны по всему тексту?   кучкуются / ровно
3. Одно и то же слово искажается одинаково каждый раз?   да / нет
4. Что слышно на таймкодах, где текст пропал: _______________________
5. Вес файла у источника: ___ МБ. Совпадает с моим?   да / нет

Вывод (нужное оставить):
  дело в записи — новый файл или пометка «неразборчиво»
  дело в редких словах — замена по всему тексту, список: ______________
  дело в спикерах — переназначить подписи по таймкодам
  дело в файле — перезалить оригинал, а не пересланную копию

Заполняется по одному фрагменту, а не по всей записи: на 60 минутах вычитки терпение кончается раньше, чем находится причина. Пункт 5 закрывает самый обидный случай — расшифровку копии копии.

Три вопроса разводят три разные ситуации: сигнала не было, сигнал был трудным, сигнал был нормальным, а слово редким. Лечится каждая по-своему.

Дерево: симптом → причина → что делать

Когда фрагмент разобран, поломка обычно называется точно. Дальше работает простое дерево: у каждого симптома одна-две типовые причины, и для каждой есть понятное действие — либо правка за минуту, либо прямое «это не восстановится».

Три ветки требуют трёх разных действий. Правка помогает во второй и третьей, а в первой сначала надо понять, есть ли что восстанавливать.

Та же логика подробнее — по каждому из шести симптомов, с проверкой, которая занимает меньше минуты.

Симптом в текстеОбычная причинаПроверка за минутуЧто делать
Спикеры слиплисьПохожие голоса, наложение речи, общий микрофонПослушать спорную минуту: разные ли это людиПереназначить подписи по таймкодам
Пропали кускиПровал в записи: перегруз, обрыв связи, речь тише фонаСовместить пропуск с записью по таймкодуПометить «неразборчиво»
Каша в терминахРедкая лексика: жаргон, названия, аббревиатурыСлово искажается одинаково в каждом появленииОдна замена по всему тексту
Неверные числа и фамилииКороткое слово, мало сигнала, нет подсказки контекстаВыписать числа и имена, сверить по плееруПравить, сверяясь с записью
Текст обрываетсяФайл короче, чем кажется, или повреждёнОткрыть исходник и досмотреть до концаПерезалить оригинал, а не пересланную копию
Фразы из ниоткудаУчасток без речи: пауза, музыка, ровный шумПослушать этот таймкод — слов там нетУдалить кусок, а запись впредь обрезать

Как выглядит проблемный звук

Формулировка «плохой звук» слишком общая: плохим он бывает пятью разными способами, и последствия у них разные. Полезно один раз посмотреть на запись глазами — в любом плеере с дорожкой видно то, что на слух проскакивает мимо.

Проблема видна на дорожке раньше, чем в тексте: срезанные пики, амплитуда на уровне фона или тишина там, где в расшифровке вдруг появились слова.

Перегруз — самая необратимая история. Если при записи встречи микрофон стоял слишком близко или уровень записи выкрутили в потолок, пики волны упираются в предел и срезаются. Срезанную верхушку не вернуть ничем: этих значений в файле физически нет, а на слух получается хрип, в котором согласные не различаются. Увидеть перегруз можно до загрузки — по сплошной «колбасе» на дорожке.

Дистанция и эхо работают тише, но портят не меньше. Отодвиньте микрофон вдвое дальше — полезный сигнал заметно ослабнет, а количество отражений от стен, стекла и стола останется прежним. В переговорке с голыми поверхностями голос с дальнего конца стола приходит вместе со своей копией, запаздывающей на доли секунды. Человек такое эхо мысленно вычитает и почти его не замечает, автоматика — нет.

Наложение речи — отдельный класс сложности, и это измеряют открытыми испытаниями. В публичных соревнованиях по распознаванию застольного разговора — микрофоны расставлены по комнате, люди перебивают друг друга, в фоне посуда и телевизор — доля ошибочных слов у сильнейших команд остаётся двузначной, тогда как на чистой речи распознавание почти безошибочно. Практический вывод один: трое, говорящие разом из разных углов комнаты, лечатся не сменой сервиса, а отдельными микрофонами и просьбой не перебивать. Почему наложение речи ломается именно так, видно из того, как работает распознавание речи.

Почему система ошибается там, где человек понимает

Распознавание речи — это не чтение и не «прослушивание». Это выбор самой правдоподобной последовательности слов при данном звуке. Отсюда три следствия, которые объясняют почти все странности в расшифровках.

  1. Где мало сигнала, появляется догадка. Система редко оставляет пустое место: она подставляет то, что вероятнее. Поэтому ошибки читаются гладко — на них не спотыкаешься глазом, и это опаснее откровенной абракадабры.
  2. Редкое слово проигрывает частому. Фамилия, название продукта, внутренняя аббревиатура встречаются в языке несравнимо реже похожего бытового слова — и проигрывают ему при любой неуверенности в звуке. Отсюда и стабильность ошибки: она закономерна.
  3. Контекст помогает, но не всегда. Длинную фразу вытягивает окружение: соседние слова подсказывают, что было сказано. Короткое число или имя такой поддержки лишено — потому цифры и фамилии страдают чаще всего.
Отсюда и гладкие фразы на пустом месте: пустое место системе выдать труднее, чем правдоподобный текст.

Отсюда же берутся фразы на пустом месте. На участках, где речи не было — тишина, музыкальная заставка, ровный шум, — система всё равно может выдать связный текст. Эффект известный, его отдельно изучают в открытых работах: не-речевой звук порождает устойчивые ложные вставки, причём одни и те же от записи к записи. Вывод: подозрительно гладкую фразу в начале, в конце или посреди паузы проверяйте по записи, прежде чем переносить в документ.

Отдельная история — записи, прошедшие через телефонную линию: часть звуковой информации там теряется ещё до того, как файл вообще появился, и вернуть её невозможно ничем. Классический телефонный канал передаёт полосу примерно 300–3 400 Гц, тогда как обычная запись на 16 кГц дискретизации доносит до 8 000 Гц — вдвое больше по верхней границе. Отрезается там как раз верх, где различаются шипящие и свистящие: «с», «ф», «ш» звучат почти одинаково, и текст начинает путать похожие слова. Для диагностики важно ровно одно: такие ошибки не лечатся сменой сервиса, потому что все сервисы получают на вход один и тот же обеднённый сигнал.

Второе место, где сигнал беднеет уже по вашей вине, — пересылка. Вес считается в одно действие: битрейт умножить на длительность и разделить на 8. Запись 64 кбит/с длиной 3 600 секунд даёт около 28 МБ; она же, ужатая мессенджером до 16 кбит/с, весит примерно 7 МБ — 75 % данных выброшено, причём выброшено повторно, поверх исходного сжатия. Отсюда правило, которое экономит вечер: сравните вес файла у себя и вес оригинала в источнике. Разница в 3–4 раза означает, что вы расшифровываете копию копии, а оригинал лежит в двух кликах.

Из всего этого следует главное правило доверия к расшифровке: сверяют не весь текст, а числа и имена собственные. В часовом разговоре их обычно два-три десятка, у каждого стоит таймкод, и полчаса подозрений закрываются пятью минутами кликов по плееру. Что именно влияет на результат и на чём качество теряется сильнее всего — разобрано отдельно: качество распознавания речи.

Что чинится за минуту, а что не чинится вовсе

После диагностики список дел короткий, и он делится на три части: что закрывается правкой, что — повторной загрузкой, а что не закрывается ничем.

Правится в редактореПодписи говорящих, лишний спикер, термины, числа и фамилии. 10–15 точечных правок на запись в 60 минут.
Правится перезагрузкойПережатая копия вместо оригинала, обрезанный файл, не тот язык, не та дорожка. Минута работы, результат другой.
Не правится ничемСрезанные перегрузом пики, речь тише фона, трое говорящих одновременно издалека. Здесь помогает только новая запись.

Первая группа — точечная вычитка: править приходится не текст целиком, а отдельные слова, и делается это по таймкодам — клик по строке проигрывает именно этот момент записи, так что одна правка занимает секунды. Вторая обиднее всего: человек меняет сервис, хотя достаточно было взять исходный файл. Третья — повод не тратить вечер, а признать, что запись не удалась.

  • Не переписывайте текст целиком. Правьте то, на что будете ссылаться: решения, суммы, сроки, имена. Остальное можно оставить как есть — на понимание это не влияет.
  • Не додумывайте пропуски. Пометка «неразборчиво» честнее правдоподобной догадки, а через месяц именно эта разница окажется важной.
  • Не «улучшайте» звук после того, как текст уже неровный. Агрессивная чистка выедает окончания слов вместе с шумом, и ошибок обычно становится больше, а не меньше.

Как вытащить пользу из уже неровного текста

Даже посредственная расшифровка обычно содержит всё, ради чего затевалась. Искать в ней нужно иначе: не читать подряд, а идти по структуре разговора и по спорным точкам.

Автоматические разделы записи с описанием и временем начала каждого
Даже по неровному тексту навигация работает: разделы показывают, где искать нужный кусок, и слушать приходится минуту, а не час.
  1. Начните с конца. Договорённости почти всегда в последней трети разговора. Найдите в тексте «давайте тогда», «итого», «до какого числа» — и слушайте только эти минуты.
  2. Выпишите числа и имена отдельным списком. Суммы, даты, сроки, фамилии, номера договоров. Каждое проверяется по плееру за секунды, и после этого документу можно доверять.
  3. Спорное слушайте на замедленной скорости. Скорость 0,75 вытаскивает окончания и разницу между «шестнадцатого» и «шестидесятого» надёжнее любой обработки звука.
  4. Переименуйте говорящих один раз. «Спикер 2» → Клиент: подпись меняется сразу по всему диалогу, и текст становится читаемым без дополнительной вычитки.
  5. Соберите поверх текста сводку. Итог, решения и задачи устойчивее к мелким огрехам, чем дословная стенограмма: ошибка в одном слове редко меняет смысл решения.
  6. Непонятное спрашивайте, а не ищите. Вопрос по записи возвращается с прямой цитатой и отметкой времени — её можно тут же переслушать и убедиться самому.
Поиск по неровной расшифровке: маркерная фраза подсвечена, видно число её повторов
Разбор проще начинать не с начала, а с маркеров: «давайте тогда», «итого», «до какого числа». Найденные места и есть те минуты, которые стоит переслушать.

Когда текст неровный, короткий документ поверх него полезнее самой расшифровки: решения и задачи с именами и сроками собираются из смысловых кусков, а не из каждого слова. Проверять там нужно немного — те же числа и фамилии, и каждый пункт снабжён ссылкой на секунду, где это прозвучало. От чего зависит итоговое качество расшифровки, полезно понимать заранее.

Ответ ИИ-помощника на вопрос «Кратко перескажи разговор»: суть записи несколькими фразами, с именами участников
На неровном тексте смысловая выжимка полезнее дословной: она собирается из кусков, а не из каждого слова. Проверять в ней нужно немного — те же числа и фамилии.

Слипшихся говорящих правят там же: спорные куски находятся по таймкодам и переназначаются вручную, а имена сервис по возможности подставляет из самого разговора — если участники представились в начале. Подробнее о том, как это устроено и где ошибается: разделение спикеров.

Как записать так, чтобы диагностика не понадобилась

Все перечисленные проблемы решаются в одном месте — на записи, и стоят там копейки времени. 20 секунд проверки перед стартом экономят вечер вычитки.

  1. Микрофонближе к говорящему, не в центр стола
  2. Уровеньпроба 20 секунд, пики не в потолок
  3. Разговорпредставились, стараются не перебивать
  4. Файлоригинал, а не пересланная копия
  • Дистанция важнее цены микрофона. Дешёвая гарнитура в 30 сантиметрах даёт результат лучше, чем дорогой микрофон в 3 метрах. Если участников несколько, лучше несколько источников звука, чем один «на всех».
  • Сделайте пробу. 20 секунд, прослушать, посмотреть на дорожку. Единственный способ поймать выкрученный уровень или не тот вход до, а не после разговора.
  • Просите представляться в начале. Одна фраза «Ирина, продукт» на старте — и подписи в расшифровке появятся сами, без ручного переименования.
  • Отдельные дорожки, если платформа умеет. Когда каждый участник пишется в свой канал, наложение речи перестаёт быть проблемой в принципе.
  • Уберите ровный фон. Кондиционер, вытяжка, вентилятор ноутбука: их не замечают на встрече, но на записи они присутствуют все 60 минут.
  • Забирайте оригинал. Скачивайте файл из источника, а не пересылайте его через мессенджер: каждое пересжатие отнимает у распознавания часть признаков.

Про то, какой формат аудио лучше для расшифровки, и способы получить исходник — от диктофона до выгрузки из платформы для встреч — есть отдельный разбор: гайд по расшифровке аудио и видео. Если запись ещё предстоит, полчаса на подготовку окупаются на первом же файле. А когда файл уже на руках, отдельный вопрос — что с ним имеет смысл сделать до загрузки, а что только испортит текст.

Проверьте на сложном фрагменте, а не на простом

Возьмите те самые три минуты, где текст рассыпался, и загрузите их в Vibe2Text: расшифровка придёт с разделением говорящих и таймкодами, а поверх неё соберётся сводка с решениями и задачами.

Проверить качество на своей записи

Бесплатный старт без карты, файлы до 4 ГБ и до 6 часов. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.

Частые вопросы

Плохая расшифровка — что делать в первую очередь?

Не перезагружать файл в другой сервис, а взять фрагмент на две-три минуты и послушать его в наушниках, глядя в текст. Если вы сами не разбираете половину слов — проблема в записи, и сменой инструмента она не решается. Если разбираете, смотрите, где ошибки кучкуются: на наложении речи, на редких словах или ровно по тексту.

Почему нейросеть плохо распознаёт речь, хотя человек всё понимает?

Человек знает тему, помнит контекст и достраивает пропущенное по смыслу — фактически он слышит не только звук. Автоматика выбирает самую вероятную последовательность слов по имеющемуся сигналу, и там, где сигнала мало, вместо честного пропуска подставляет догадку. Поэтому ошибки читаются гладко.

Много ошибок в транскрибации — поможет ли другой сервис?

Иногда да, но проверять стоит на одном трудном фрагменте, а не на всей записи. Если оба текста разваливаются в одних и тех же местах — там, где говорили разом или издалека, — дело в записи: любой инструмент получит тот же звук. Если один справляется и с чистыми участками, а другой нет, разница есть.

В расшифровке появились фразы, которых точно не было. Откуда они?

Так проявляются участки без речи: пауза, музыкальная заставка, ровный фоновый шум. На них система может выдать связный текст, и такие вставки нередко повторяются от записи к записи — эффект описан в открытых исследованиях. Проверяйте гладкие фразы в начале, в конце и в местах тишины по таймкоду, а в следующий раз обрезайте вступительную музыку и длинные паузы.

Сервис слепил двух человек в одного спикера — это можно исправить?

Да, вручную и довольно быстро: спорные куски находятся по таймкодам и переназначаются, подпись меняется сразу по всему диалогу. Голоса слипаются, когда тембры близкие, люди перебивают друг друга или говорят в общий микрофон. Обратная ошибка — говорящих больше, чем людей в комнате — обычно значит, что метку получил голос из коридора.

Стоит ли чистить запись шумодавом перед загрузкой?

Как правило, нет. Бытовая чистка настроена на то, чтобы запись приятнее звучала, и вместе с шумом снимает окончания слов и признаки согласных, по которым различается речь. Распознаванию обычно проще с честным шумным сигналом. Пробуете — сравните оба варианта на одном фрагменте.

Текст обрывается на середине записи — это ошибка сервиса?

Чаще всего нет: обрывается сам файл. Откройте исходник и промотайте в конец — нередко выясняется, что запись остановилась раньше разговора или повредилась при выгрузке. Второй частый случай — урезанная копия, прошедшая через мессенджер. Проверяется за минуту, решается загрузкой оригинала.

Проверено 13 августа 2026. Сложность распознавания разговора нескольких человек, записанного удалёнными микрофонами в жилом помещении, — по постановке задачи и данным открытого испытания CHiME-5 (arXiv:1803.10609) и обзору его продолжения CHiME-6, где доля ошибочных слов у сильнейших систем остаётся двузначной. Ложный текст, который распознавание порождает на не-речевых фрагментах, — по исследованию arXiv:2501.11378 (январь 2025): устойчивые повторяющиеся вставки на шуме, музыке и тишине. Полоса классического телефонного канала (примерно 300–3 400 Гц) — по рекомендации ITU-T G.712, задающей характеристики передачи узкополосного речевого тракта; верхняя граница обычной записи выводится из частоты дискретизации по теореме Котельникова (16 кГц дискретизации — до 8 000 Гц). Вес файла считается арифметикой, приведённой в тексте: битрейт × длительность ÷ 8 (64 кбит/с × 3 600 с ≈ 28 МБ, 16 кбит/с ≈ 7 МБ). Утверждения о срезанных при перегрузе пиках и о потере полезного сигнала с расстоянием — из базовых свойств цифровой записи и акустики помещения.