Вся запись получилась тихой: усиление, нормализация и предел спасаемого

РАЗБОР

Вся запись получилась тихой: усиление, нормализация и предел спасаемого

Слышно всех одинаково плохо, а переснять нельзя. Где по дороге теряется громкость микрофона, чем нормализация отличается от усиления и компрессии и как за минуту понять, есть ли в файле что спасать.

Запись вышла тихой: где по дороге потерялась громкость

Полтора часа переговоров, файл открывается — и слышно всех одинаково плохо. Не один участник тише другого, а вся запись целиком: приходится выкручивать плеер на максимум и всё равно вслушиваться. Первое, что делает человек в этой ситуации, — ищет, где настраивается громкость микрофона. Настройка действительно существует, но потерялась громкость обычно не в ней.

Между ртом говорящего и числами в файле стоит цепочка, и громкость теряется на любом её звене. Причём потери складываются: полметра лишнего расстояния плюс чехол плюс низкий уровень входа дают не сумму неудобств, а запись, которую невозможно слушать.

Три звена, и каждое отнимает свою долю. Ни одно из них не восстанавливается после записи — потому и стоит потратить десять секунд до неё.

Шесть причин, по которым запись выходит тихой целиком

Разберём по порядку — от самых частых к самым обидным. Колонка «чинится после» здесь важнее остальных: она показывает, стоит ли вообще открывать редактор.

ПричинаКак это звучитЧинится после записи
Микрофон далеко от говорящихровно тихо всю запись, слышна комнатачастично
Устройство в кармане или сумкеглухо и тихо, как из-под подушкиплохо
Чехол, ладонь или бумаги на микрофонетихо и без верхних частотплохо
Низкий уровень входатихо, но чистода, полностью
Автоматическая регулировка усилениягромкость гуляет, в паузах шипитчастично
Тихое помещение и тихие голосатихо и чисто, фон почти нулевойда, полностью

Обратите внимание на закономерность: чинится то, где тихо, но чисто. Низкий уровень входа и тихий разговор в тихой комнате поднимаются полностью и без последствий — в файле лежит нормальная речь, просто записанная маленькими числами. А карман, чехол и большое расстояние приносят вместе с тишиной то, что усилением не разделишь: гул комнаты, шорох ткани и потерянные верхние частоты.

Автоматическая регулировка усиления: почему громкость гуляет

Отдельная строка в таблице заслуживает пояснения, потому что её последствия выглядят странно. Автоматическая регулировка усиления — АРУ, она же AGC — есть почти во всех диктофонах телефонов, веб-камерах и платформах для созвонов. Она постоянно измеряет входящий уровень и подкручивает усиление: тихого говорящего поднимает, громкого придерживает, чтобы на выходе получалась примерно одинаковая громкость.

  • В паузах громкость растёт. Речь кончилась — уровень упал — АРУ решает, что стало тихо, и поднимает усиление, вытаскивая наверх кондиционер и шорохи. Это тот самый шипящий фон между фразами.
  • Начало фразы прижимается. Человек заговорил, уровень скакнул, автоматика опускает усиление — и первые слоги успевают прозвучать не так, как остальная фраза.
  • Дальний участник то есть, то нет. АРУ ориентируется на самый громкий голос в комнате: пока говорит ближний, дальний прижат вместе с фоном.
  • Общая громкость всё равно низкая. Если в комнате постоянный фон, автоматика держит запас до потолка и не даёт речи выйти на нормальный уровень — получается ровно тихая запись с ровным шипением.

Сначала проверьте, есть ли в файле сигнал

Прежде чем что-то усиливать, стоит потратить минуту на диагностику. Она отвечает на единственный вопрос, от которого зависит всё остальное: речь в файле громче фона или нет. Всё остальное — детали.

Уровень в цифровом файле меряют в dBFS — децибелах относительно полной шкалы. Ноль здесь не тишина, а потолок: 0 dBFS — максимальный уровень, который вообще можно записать, и все реальные значения идут ниже него, со знаком минус. Типовой ориентир для речи — держать средний уровень в районе −20 dBFS, чтобы до потолка оставался запас в те самые восемнадцать-двадцать децибел на неожиданный смех или хлопок двери.

Ноль — это потолок, а не тишина. Слева запас есть, справа его нет: всё, что упёрлось в 0 dBFS, срезается и обратно не собирается.
  1. Откройте файл там, где видно форму волны. Любой бесплатный редактор рисует дорожку целиком. Тонкая нитка посередине — тихо; толстая полоса, прижатая к краям, — перегруз.
  2. Посмотрите на паузы. В нормальной записи между фразами почти ровная линия. Если в паузах полоса заметной толщины — это фон, и он поднимется вместе с речью.
  3. Сравните речь и паузы на глаз. Речь заметно выше фона — вытянется. Речь и фон одной толщины — не вытянется ничем.
  4. Послушайте в наушниках на полной громкости. Слышны слова, пусть с усилием, — сигнал есть. Слышно только ровное шипение — записывать было нечего.
  5. Проверьте крайний случай. Идеально прямая линия на всей дорожке означает цифровой ноль: микрофон не был подключён или его перехватило другое приложение. Спасать нечего, и лучше узнать это сразу.
Плеер под расшифровкой тихой записи: спорный фрагмент проигрывается кликом по строке
Второй способ проверки — от текста. Там, где речь в файле была тише фона, расшифровка идёт обрывками, и это видно раньше, чем вы откроете редактор.

Усиление, нормализация и компрессия: чем они отличаются

Дальше начинается место, где теряют больше всего времени. Три слова звучат как три разных инструмента, а на деле два из них — одно и то же действие.

Первые две строки — одна и та же операция, разница только в том, кто выбирает число. Третья — единственная, которая меняет соотношение внутри файла.
ОперацияЧто происходит с файломМеняет ли соотношение речи и фона
Усилениекаждый отсчёт умножается на одно число, выбранное ваминет
Нормализациято же умножение, но множитель считает программа — до заданного уровнянет
Компрессиягромкие места придерживаются, тихие подтягиваютсяда, и не всегда в вашу пользу

Вот главный вывод, который экономит вечер: усиление и нормализация — одна операция. И та и другая умножают весь файл на число. Разница в том, что при усилении число выбираете вы на глаз, а при нормализации программа сама измеряет текущий уровень и подбирает множитель так, чтобы результат попал в цель. Никакого «улучшения» в нормализации нет — это аккуратно посчитанное усиление, не более.

Отсюда следует то, что многие проверяют на собственном опыте по два-три раза: умножение не может изменить соотношение речи и фона. Если голос был на шесть децибел выше гула, после любого множителя он останется на шесть децибел выше гула. Громче станет всё вместе — и речь, и кондиционер, и шипение тракта.

Компрессия — единственная из трёх, которая соотношение меняет. Она применяет разные множители в разные моменты: там, где громко, придерживает, там, где тихо, подтягивает. Для тихой записи с ровной речью это работает хорошо. Для тихой записи с заметным фоном — плохо: в паузах между фразами компрессор находит тот же фон и честно подтягивает его к уровню речи. Получается ровная громкость и ровное шипение, ровно как у автоматики при записи.

Клиппинг: почему после него ничего не вернуть

У громкости есть потолок, и он жёсткий. Цифровая запись — это последовательность чисел, и у каждого числа есть максимум, который помещается в отведённые ему разряды. Когда сигнал пытается выйти выше, лишнее просто не записывается: вершина волны срезается по прямой.

Плоские площадки вместо вершин — это не искажение формы, а отсутствие данных. Там, где была верхушка слога, в файле лежит одно и то же максимальное число.

Восстановить это нельзя ни одним инструментом — и причина принципиальная, а не техническая. Обработка распоряжается тем, что в файле есть; на месте срезанной вершины в файле не «плохие» данные, а одинаковые. Программы, обещающие восстановление клиппинга, дорисовывают правдоподобную форму по соседним отсчётам — это догадка, а не реставрация, и на речи она чаще добавляет призвуков, чем разборчивости.

Что делать с тихой записью, которая уже есть

И теперь главное — если из записи нужен текст, а не звук, поднимать громкость чаще всего не нужно вовсе.

Распознаванию абсолютная громкость почти безразлична: перед разбором сигнал всё равно приводится к своему рабочему уровню, и ваше умножение на два просто продублирует эту работу. Значение имеет соотношение речи и фона — а его, как мы выяснили, умножение не меняет. Поэтому порядок такой: сначала текст как есть, и только потом, если он вышел рваным, разбор причины.

Загрузка тихой аудиозаписи на расшифровку без предварительной обработки
Файл идёт как есть: mp3, m4a, wav, ogg — конвертировать и «подтягивать» заранее не требуется. Лишнее пережатие тихую запись только испортит.
  1. Сделайте копию оригинала. Обработка необратима, и вернуться к исходнику захочется чаще, чем кажется.
  2. Отправьте файл на расшифровку без обработки. Часто выясняется, что текст читается: то, что вы разбирали с третьего раза, разбирается с первого.
  3. Оцените результат по тексту, а не на слух. Ровно посредственный текст по всей длине — низкий уровень при чистом сигнале. Обрывки и пропуски целыми фразами — речь была вровень с фоном.
  4. Пройдите по местам, где потеря дороже всего. Суммы, даты, фамилии, номера договоров: у каждой реплики стоит время, и спорное переслушивается кликом.
  5. Замедлите спорный фрагмент до 0,75. На тихой записи это работает лучше усиления: окончания слов слышны там, где на нормальной скорости была каша.
  6. Только теперь нормализуйте — если нужен сам звук. Для пересылки коллеге или для приложения к письму громкость важна; для текста она уже сыграла свою роль.
Расшифровка тихой записи: реплики со временем, по которым видно, где текст рвётся
Текст сам показывает диагноз. Ровная посредственность по всей длине и обрывки в отдельных местах — разные болезни с разным исходом.
  1. Копияоригинал в сторону
  2. Текст как естьбез обработки
  3. Диагнозтихо или тихо и шумно
  4. Точкицифры и фамилии по таймкоду

Где проходит предел спасаемого

Скажем прямо, потому что вокруг обработки звука много обещаний. Тихую запись поднять можно — и часто до полностью рабочего состояния. Но у этого есть жёсткая граница, и проходит она не там, где кажется.

Тихо, но чистоРечь заметно выше фона. Вытягивается полностью, обычной нормализацией, без потерь и без побочных эффектов.
Тихо и фон рядомРечь и гул на одном уровне. Громкость поднимется, разборчивость — нет: множитель поднимает оба.
Ноль или срезСигнала нет вовсе или вершины упёрлись в потолок. Не восстанавливается ничем — ни редактором, ни сервисом.

Обработка не добавляет в файл информацию — она по-разному распоряжается той, что уже записана. Если в момент записи голос не поднялся над фоном, признаков речи в сигнале не осталось, и никакое усиление их не создаст. Это же относится и к срезанным вершинам: там, где значений нет, восстанавливать нечего. Вечер, потраченный на фильтры, в этих двух случаях не вернёт ничего, а те же полтора часа хватило бы, чтобы собрать содержание другим путём — переспросить участников или свести то, что вытащилось, в короткий итог.

Отдельно стоит сказать про соблазн прогнать тихую запись через шумодав на максимуме. На тихой речи это худшее из возможных решений: подавление шума срезает вместе с фоном согласные и окончания, а их у тихого сигнала и так немного. Где проходит граница между полезной чисткой и вредной, разобрано в статье про шумоподавление и качество записи; а если текст вышел рваным и непонятно, звук виноват или что-то ещё, есть отдельная диагностика — почему расшифровка получилась плохой.

Десять секунд до записи: где на самом деле настраивается громкость микрофона

Всё, что действительно решает задачу, делается до нажатия кнопки. Проверка занимает 10 секунд и экономит те 40 минут, которые иначе уйдут на попытки вытянуть готовый файл. Порядок один и тот же для диктофона, ноутбука и созвона.

  1. Запишите 10 секунд и послушайте их. Скажите пару фраз обычным голосом с того места, где будете сидеть. Не «раз-раз» вплотную к микрофону — так проверяется не то.
  2. Смотрите на индикатор, а не на слух. Полоска уровня должна на речи уверенно доходить до середины шкалы и не упираться в конец. Если она еле шевелится — уровень низкий; если постоянно в упоре — перегруз.
  3. Уберите преграду. Достаньте телефон из кармана и из-под бумаг, снимите толстый чехол, не накрывайте устройство ладонью. Это самый дешёвый плюс к громкости из всех существующих.
  4. Сократите расстояние вдвое. Оно работает сильнее любых настроек: подвинуть устройство ближе почти всегда дешевле, чем потом вытягивать файл.
  5. Поднимите уровень входа, если он низкий. В свойствах микрофона на компьютере это ползунок уровня и отдельное усиление; в приложениях записи — чувствительность. Ставьте так, чтобы речь шла в середине шкалы, а не под потолок.
  6. Решите, что делать с автоматикой. Оставляете АРУ — получаете ровную, но приподнятую в паузах запись. Выключаете — отвечаете за уровень сами, и тогда десять секунд проверки обязательны.
Проверка уровня микрофона перед записью прямо в браузере
Пробные десять секунд стоит делать тем же способом, каким будете писать основное: другое приложение возьмёт другое устройство и другой уровень.

И последнее из практики: параметры файла на громкость не влияют. Час речи в mp3 при 64 кбит/с весит 29 МБ — 64 000 бит в секунду × 3600 секунд ÷ 8, — и разговору такого битрейта достаточно; пересохранить файл в 192 кбит/с можно, но громче он не станет, а вырастет втрое. То же с частотой дискретизации: разборчивость речи держится на полосе примерно до 8 кГц, и 16 кГц дискретизации покрывают её целиком, поэтому пересчёт тихой записи из 16 кГц в 48 кГц новых частот в файл не добавит. Что записалось тихо, тихо и останется. Разумные значения для речи разобраны отдельно, в статье про битрейт и частоту дискретизации.

Тихая запись — ещё не потерянная

Загрузите файл как есть, без обработки: Vibe2Text вернёт текст с разделением говорящих и таймкодами. По нему сразу видно, было в записи тихо или тихо и шумно — и что из неё вообще можно вытащить.

Проверить запись на текст

Бесплатный старт без карты, файлы до 4 ГБ и до 6 часов. Форматы mp3, m4a, wav, ogg и другие — как есть.

Частые вопросы

Тихая запись — что делать в первую очередь?

Не усиливать, а поставить диагноз. Откройте файл там, где видна форма волны, и сравните речь с паузами: если речь заметно выше фона, обычная нормализация решит вопрос целиком. Если речь и фон одной толщины, поднимать громкость бессмысленно — множитель поднимет оба одинаково. И сразу отправьте файл на расшифровку без обработки: текст покажет диагноз точнее, чем прослушивание.

Как усилить тихую запись и не вытащить вместе с ней шум?

Никак — если шум уже сидит рядом с речью. Усиление умножает весь файл на одно число, и соотношение речи и фона от этого не меняется в принципе. Разделить их можно только там, где речь заметно громче: тогда нормализация поднимает всё, но фон остаётся позади и слуху не мешает. Мягкая компрессия помогает на записи с ровной речью и почти без фона, а на шумной делает хуже: в паузах она подтягивает к уровню речи тот самый шум.

Где настраивается громкость микрофона?

До записи и в трёх местах сразу. Первое — расстояние: подвинуть устройство ближе действеннее любой настройки. Второе — преграда: карман, чехол, ладонь и стопка бумаг съедают громкость молча. Третье — уровень входа в системных свойствах микрофона или в настройках приложения записи, где рядом обычно живёт отдельный переключатель усиления. После записи настраивать уже нечего: остаётся только умножать то, что получилось.

Чем нормализация отличается от простого усиления?

Только тем, кто считает множитель. Усиление умножает файл на число, которое выбрали вы; нормализация измеряет текущий уровень и подбирает число сама, чтобы результат попал в заданную цель. Действие одно и то же, и «улучшения» в нормализации нет — она просто не промахивается мимо потолка.

Что такое клиппинг и можно ли его убрать?

Это срез вершин волны о потолок цифровой шкалы: 0 dBFS — максимальный уровень, который вообще можно записать, и всё, что выше, не сохраняется. Убрать нельзя: на месте вершины лежат не искажённые данные, а одинаковые. Программы «восстановления клиппинга» дорисовывают форму по соседним отсчётам — это догадка, и на речи она обычно добавляет призвуков, а не разборчивости.

Нужно ли поднимать громкость перед отправкой на расшифровку?

Нет. Абсолютная громкость распознаванию почти безразлична — сигнал перед разбором всё равно приводится к рабочему уровню. Значение имеет соотношение речи и фона, а умножение его не меняет. Поднимать громкость имеет смысл, когда нужен сам звук: переслать коллеге, приложить к письму, выложить записью.

Как понять, что в файле вообще нет сигнала?

Три признака. Форма волны на всей дорожке — прямая линия без утолщений. В наушниках на полной громкости слышно ровное шипение и ни одного слова. Расшифровка возвращает пустоту или отдельные случайные слова. В этом случае микрофон не был подключён или его перехватило другое приложение, и спасать нечего — запись придётся делать заново.

Проверено 15 августа 2026. Определение dBFS (децибелы относительно полной шкалы), правило «0 dBFS — максимально возможный уровень, все значения не больше нуля» и то, что превышение этого потолка даёт цифровой клиппинг, — по статье dBFS в англоязычной Википедии и справочным материалам по цифровым уровням. Ориентир по построению уровней — средний рабочий уровень около −20 dBFS с запасом до потолка порядка 18–20 дБ — по руководству Biamp «Gain structure: input and output levels»; распространённая практическая рекомендация для записи речи — держать пики в диапазоне примерно −12…−6 dBFS. Соотношение «около 6 дБ динамического диапазона на каждый бит разрядности» — общепринятое правило для импульсно-кодовой модуляции. Связь полосы и частоты дискретизации — по теореме Котельникова (Найквиста): частота дискретизации должна вдвое превышать верхнюю частоту полезной полосы, поэтому речевой полосе до 8 кГц соответствуют 16 кГц дискретизации. Вес файла посчитан из битрейта: 64 000 бит в секунду × 3600 секунд ÷ 8 = 28,8 МБ на час. Описание автоматической регулировки усиления (AGC) и характерного эффекта подъёма фона в паузах из-за быстрого времени восстановления — по отраслевым материалам об AGC в записи звука и видео.