
РАЗБОР
На записи не слышно собеседника: почему так вышло и что теперь делать
Свой голос звучит нормально, а второй участник еле различим — и как раз его реплики нужны. Разбираем, откуда берётся перекос, что успеть до записи и что вытягивается из файла, который уже такой.
Один звучит нормально, второго еле слышно
Час переговоров записан, файл открывается — и выясняется неприятное: ваши реплики звучат отчётливо, а собеседник бормочет откуда-то из соседней комнаты. Причём именно он называл сумму и сроки. Ситуация «на записи не слышно собеседника» — самая частая жалоба после встреч за столом, интервью и разговоров по громкой связи.
Важно сразу развести две разные беды. Первая — тихо: голос есть, он просто слабее соседнего. Вторая — неразборчиво: голос утонул в гуле, эхе или шипении фильтра. Лечатся они по-разному, и половина потраченных вечеров уходит на то, что человек пытается «сделать громче» там, где громкости и так достаточно, а разборчивости нет.
Пять причин, по которым один участник тише остальных
Причины складываются: на живой встрече их обычно две-три сразу. Полезно опознать свою — от этого зависит, чинится ли она вообще.
| Причина | Как это звучит в файле | Чинится до записи | Чинится после |
|---|---|---|---|
| Устройство лежит ближе к одному | ровный перекос по всей записи | да, за минуту | частично |
| У одного гарнитура, у остальных нет | один вблизи, прочие как фон комнаты | да | плохо |
| Тихий голос сам по себе | перекос сильнее в конце встречи | да, местом и петличкой | частично |
| Человек говорит в сторону или в стол | голос то появляется, то уходит | да, просьбой | нет |
| Между ним и микрофоном шумит | тихий голос тонет в гуле | да, если убрать источник | нет |
Последние две строки — самые обидные. Когда человек отвернулся или между ним и микрофоном работает кондиционер, в файл попадает не «тихая речь», а речь пополам с комнатой. Усиливать там нечего: поднимется всё вместе.
Геометрия стола: почему середина честнее края
Физика тут простая и неумолимая. Звуковое давление от источника падает обратно пропорционально расстоянию — в децибелах это те самые 6 дБ на каждое удвоение дистанции. Один шаг назад от микрофона стоит дороже, чем кажется на слух.
Переведём в стол переговоров. Телефон лежит перед вами: до вашего рта 0,5 метра, до собеседника напротив — 2 метра. Это два удвоения подряд, то есть около 12 дБ разницы. На слух в комнате вы её не замечаете, потому что мозг подстраивается под говорящего; микрофон не подстраивается — он честно пишет то, что до него дошло. Цену вопроса стоит прикинуть заранее: если дальний участник говорит 12 минут из 60, под ударом 20 % встречи, и это обычно та самая часть, где называют сумму и срок.
Отсюда правила, которые ничего не стоят. Устройство — в середину, микрофоном вверх, не под бумаги и не под ладонь. Стол длиной больше двух метров лучше не «покрывать» одним телефоном вовсе: садитесь плотнее к одному краю, а устройство ставьте в центр занятой части, а не геометрического стола.
Гарнитура у одного делает перекос сильнее, а не слабее
Второй источник перекоса неочевиден: он появляется как раз тогда, когда кто-то позаботился о качестве. Микрофон гарнитуры держится в двадцати-тридцати сантиметрах ото рта и рассчитан на то, чтобы брать голос вблизи и глушить всё остальное. Для владельца гарнитуры это отлично, для остальных участников — приговор: они попадают в ту самую категорию «всё остальное».
Тот же эффект даёт направленный микрофон диктофона, повёрнутый в одну сторону, и громкая связь: телефон пишет вас вблизи, а собеседника — через динамик и половину комнаты. У собеседника вдобавок фора отрицательная: его голос уже прошёл телефонный канал шириной примерно 300–3400 Гц с оцифровкой на 8 кГц, и верх спектра, где различаются шипящие, с него срезан ещё до вашей комнаты. Правило простое: гарнитуры или у всех, или ни у кого. Смешанная схема даёт худший из вариантов — одного слышно как в студии, остальных как в коридоре.
Две минуты до начала, которые снимают проблему
Всё, что реально помогает, делается до нажатия кнопки и занимает меньше времени, чем потом уйдёт на один переслушанный фрагмент.
- Посадите тихого ближе к устройству. Самый дешёвый приём вообще: не двигать микрофон, а поменять места. Разница в один метр стоит примерно 6 дБ — больше, чем любая последующая обработка.
- Дайте петличку тому, кого хуже слышно. Петличный микрофон держит дистанцию около 20 см независимо от того, как человек повернулся, и уравнивает его с остальными.
- Договоритесь про направление. Одна фраза в начале — «говорим в сторону телефона, он посередине» — работает лучше любых настроек: люди помнят про микрофон первые 20 минут, а это как раз содержательная часть.
- Уберите шум между людьми. Проектор, кондиционер и открытое окно мешают не всем одинаково: сильнее всего они бьют по самому тихому участнику, потому что маскируют именно слабый сигнал.
- Сделайте тестовые 20 секунд. Попросите каждого назвать имя и роль, остановите запись, послушайте. Круг представлений заодно даёт системе материал, по которому она подставит имена в расшифровку.
Устройство — в середину занятой части стола, микрофоном вверх Сверху ничего: ни бумаг, ни ладони, ни чехла Самый тихий участник — ближе всех к устройству Петличка — тому, кого хуже слышно Кондиционер, проектор, открытое окно — выключить или закрыть Гарнитуры: у всех или ни у кого Вслух: «пишем звук, говорим в сторону телефона, он посередине» Тест 20 секунд: каждый называет имя и роль Прослушать тест: дальнего слышно так же, как ближнего? Заряд и свободное место проверены
Проходится меньше чем за 2 минуты и снимает почти весь перекос. Круг с именами в первых 20 секундах заодно оставляет в файле образец каждого голоса — по нему имена и подставляются в расшифровку.

Что происходит с тихой репликой при разделении говорящих
Здесь начинается то, ради чего эта статья написана. По нашей практике перекос по громкости бьёт вовсе не туда, куда ожидают: слова тихого участника чаще всего распознаются, а вот подпись под ними — нет.
Разделение говорящих опирается на приметы голоса: тембр, высоту, манеру. У далёкого и тихого участника этих примет в файле остаётся мало — вместо голоса система получает голос пополам с комнатой. Дальше происходит одно из трёх: его короткие реплики приклеиваются к соседним, длинные разъезжаются на двух «спикеров», а самые тихие «угу» и «да» не отмечаются вовсе.

Чинится это в редакторе: подписи переименовываются по всему документу одним движением, а спорные места проверяются кликом по реплике. Работа не тяжёлая, но её объём прямо зависит от того, насколько ровно записаны голоса, — и вот эта зависимость и есть главный аргумент в пользу двух минут подготовки.
Запись уже такая: как усилить тихую речь и не поднять шум
Первый порыв — открыть редактор и выкрутить громкость. Он и приводит к типичной жалобе: «сделал громче, а разобрать всё равно нельзя». Причина в том, что усиление не различает, что усиливать: вместе с голосом на те же децибелы поднимается кондиционер, шорох бумаг и дыхание в паузах.
Отсюда порядок действий, который работает. Если у вас раздельные дорожки — каждый участник писался своим микрофоном, площадка отдала запись по участникам, — это лучший случай: нормализуйте каждую дорожку отдельно, и перекос исчезнет вместе с проблемой. Ориентир для нормализации по громкости давно стандартизован: вещательная рекомендация задаёт целевой уровень −23 LUFS с допуском в пол-единицы.
Ключевое слово здесь — «по громкости», а не «по пикам». Нормализация по пиковому уровню смотрит на самый громкий отсчёт файла и ничего не знает о том, как звук воспринимается: две записи с одинаковым пиком звучат по-разному. Нормализация по громкости считает интегральный уровень всей записи — и именно она сводит двух участников к сопоставимой слышимости.
Если дорожка одна и все голоса в ней перемешаны, чудес не будет. Тут помогает мягкая динамическая обработка: компрессор с небольшим коэффициентом подтягивает тихие места, не выводя громкие в клиппинг. Агрессивные настройки делают обратное — выравнивают всё подряд, включая фон, а заодно ломают тембр, по которому система различает говорящих.
Где расшифровка справится сама, а где придётся переслушивать
Хорошая новость: порог слышимости у распознавания ниже человеческого терпения. Речь, которую вы разбираете с третьего раза, обычно превращается в текст с первого — просто потому, что системе не мешает усталость и она не отвлекается.
| Как звучит тихий участник | Что будет с текстом | Что делать |
|---|---|---|
| тише соседа, но разборчиво | текст верный, подписи спикеров могут путаться | переименовать спикеров в редакторе |
| на грани слышимости | длинные фразы распознаются, короткие теряются | проверить спорные места кликом по реплике |
| тонет в шуме и эхе | пропуски и склейки реплик | переслушать вручную, дальше — записывать иначе |
| слышно только в паузах соседа | часть фраз не попадёт в текст совсем | восстанавливать по смыслу и по своим заметкам |
Практический приём для второй и третьей строк: не вычитывайте всё подряд. Пройдите по местам, где решалось важное, — суммы, сроки, фамилии, — и проверьте их кликом по реплике. Остальное можно оставить как есть. Считается это просто: разговорный темп — около 120 слов в минуту, значит час встречи это примерно 7 000 слов, 28 страниц по 250 слов. Сплошная вычитка идёт медленнее самой записи — 90–120 минут на час, — тогда как проверка десяти спорных мест кликом занимает 5–7 минут.

Если после всех проверок текст всё-таки рваный, вопрос уже не в громкости, а в том, что в файле осталось. Разложить, звук виноват или что-то ещё, помогает диагностика из отдельного разбора — звук виноват или сервис. А что вообще влияет на результат распознавания, собрано на странице про что влияет на качество распознавания.
Чтобы в следующий раз слышно было обоих
Сведём к четырём шагам, которые повторяются от встречи к встрече.
- Местоустройство в центр занятой части стола
- Тихому — ближеили петличка, если голос слабый
- Тест 20 секундкруг представлений и прослушивание
- Текст в тот же деньспикеры правятся, пока помните голоса
Последний шаг недооценивают. Через неделю вы уже не помните, кто сидел справа, и переименование «Спикер 3» превращается в гадание. В день встречи это 30 секунд: запись загружается на расшифровку как есть, а подписи расставляются по свежей памяти.
Проверьте на своей неровной записи
Загрузите файл как есть — увидите, сколько на самом деле разобралось: реплики по говорящим, время у каждой и клик для проверки спорных мест.
Расшифровать записьСтарт бесплатный и без карты
Частые вопросы
На записи не слышно собеседника — что делать в первую очередь?
Сначала определите, тихо или неразборчиво. Включите фрагмент на максимальной громкости: если слова разбираются, но с трудом, — это громкость, и её выравнивают нормализацией. Если слышен гул, эхо или шипение, а слов нет, — усиление не поможет, в файле просто не осталось нужных деталей. Дальше загрузите запись на расшифровку: распознавание вытягивает речь, которую человек разбирает с третьего раза.
Тихий голос в записи — что делать, чтобы вытянуть его без шума?
Нормализуйте по громкости, а не по пиковому уровню, и по возможности по каждой дорожке отдельно. Если дорожка одна, используйте мягкую компрессию: она подтягивает тихие места, не выводя громкие в перегруз. Простое усиление всего файла поднимает вместе с голосом фон, поэтому разборчивее не становится.
Как усилить тихую речь в аудио перед распознаванием?
Обычно этого делать не нужно: файл принимается как есть, а лишняя обработка чаще вредит. Смысл появляется в одном случае — когда у вас раздельные дорожки участников и одна из них заметно тише: тогда её выравнивают до общего уровня и сводят заново. Всё остальное — шумодав на максимуме, многократное пересохранение, ручное вытягивание отдельных фраз — обходится дороже, чем даёт.
Почему сервис путает спикеров, если тихого участника всё-таки слышно?
Потому что разделение говорящих опирается на приметы голоса, а у далёкого участника их в записи мало: тембр смешан с отражениями комнаты. Слова при этом распознаются, а подписи под ними плывут — короткие реплики приклеиваются к соседним, длинные разъезжаются на двух спикеров. Правится это переименованием в редакторе, а предотвращается расстановкой микрофона.
Куда класть телефон на переговорах, чтобы слышно было всех?
В середину занятой части стола, микрофоном вверх, не под бумаги и не под ладонь. Звуковое давление падает примерно на 6 дБ при каждом удвоении расстояния, поэтому телефон, лежащий перед вами, делает дальнего собеседника многократно тише. Если стол длинный, лучше сесть плотнее, чем надеяться на чувствительность микрофона.
Поможет ли петличка, если у человека просто тихий голос?
Да, это самый надёжный вариант для такого случая. Петличный микрофон держится примерно в двадцати сантиметрах ото рта и не зависит от того, как человек повернулся, — тихий участник приходит в запись на одном уровне с остальными. Если петлички нет, работает бесплатная замена: посадить его ближе к устройству.
Можно ли восстановить реплики, которых нет в записи?
Нет. Если голос был ниже уровня фона, в файле не осталось информации, из которой их можно достать, — ни обработкой, ни другим сервисом. Восстанавливают такие места по смыслу разговора и по своим заметкам, а вывод делают на будущее: перекос по громкости чинится до записи, а не после.
Проверено 15 августа 2026 года. Падение звукового давления с расстоянием (обратная пропорциональность расстоянию, около 6,02 дБ на каждое удвоение дистанции) — по статье Inverse-square law. Целевой уровень нормализации по громкости −23 LUFS с допуском ±0,5 LU (и ±1 LU для материалов вроде прямых эфиров), а также разница между нормализацией по громкости и по пиковому уровню — по рекомендации EBU R 128 и её описанию в статье EBU R 128. Полоса телефонного канала 300–3400 Гц и частота дискретизации 8 кГц — по рекомендации ITU-T G.711 для узкополосной телефонии. Наблюдение о том, что при перекосе громкости первым страдает разделение говорящих, а не распознавание слов, и оценка темпа сплошной вычитки (90–120 минут на час записи против 5–7 минут на выборочную проверку спорных мест) — собственная практика Vibe2Text на записях встреч с тремя и более участниками, август 2026.