Шум на записи: что чинится обработкой, а что уже не спасти

ГАЙД

Шум на записи: что чинится обработкой, а что уже не спасти

Файл записан, переснять нельзя, а в нём гудит вентиляция, кто-то кашляет и работает телевизор за стенкой. Четыре типа помех с разными исходами, честная граница возможного и порядок действий, в котором обработка стоит не первой.

Шум шуму рознь: четыре типа с разными исходами

Запись уже сделана: полтора часа переговоров, вернуться и переснять невозможно. В файле — гул вентиляции, чей-то кашель, звон посуды из коридора и телевизор за стенкой. Вопрос, как убрать шум из аудиозаписи, звучит одинаково для всех четырёх помех, а вот ответ у них разный: одна снимается почти бесследно, вторая портит секунды, третья не убирается в принципе, а четвёртая вообще не шум.

Порядок не случайный: сверху вниз падает не громкость помехи, а предсказуемость. Обработка умеет вычитать только то, что ведёт себя одинаково от секунды к секунде.

Логика тут одна и стоит того, чтобы её понять один раз. Любой шумодав строит модель помехи: слушает участки без речи, запоминает, как выглядит фон, и вычитает эту картинку из всего файла. Работает приём ровно настолько, насколько помеха постоянна. Как только фон меняется от секунды к секунде — модель промахивается и начинает выгрызать куски из речи.

Ровный фон: единственный случай, когда шум из аудиозаписи реально убрать

Сюда попадает всё, что гудит непрерывно и не меняется: кондиционер, вытяжка, вентилятор ноутбука, серверная за стеной, дорога под окном, ровное шипение дешёвого микрофонного тракта. На слух это самый раздражающий шум, а технически — самый безобидный.

Причина в том, что у такой помехи неизменный спектр. Алгоритм измеряет его в паузах и вычитает во всём файле — приём старый, надёжный и как раз на постоянный фон рассчитанный. Речь при этом почти не страдает: голос заметно громче гула, и вычитание задевает его по краям, а не в середине.

Не «в ноль»Убрать гул на две трети безопасно почти всегда. Попытка вычистить его целиком добавляет искажений больше, чем убирает помех.
Один проходДважды прочищенный файл звучит глуше: второй проход работает уже по искажённому сигналу и принимает его артефакты за фон.
Оригинал отдельноОбработка необратима — из вычищенного файла исходник обратно не собирается, а возвращаться к нему приходится часто.

И способ проверить себя, который занимает пять минут. Возьмите три минуты записи с худшим текстом, прогоните через чистку только их и положите две расшифровки рядом. Судить по тому, приятнее ли стало слушать, в этой задаче бесполезно: ухо и распознавание оценивают запись по разным признакам.

Резкие звуки: теряются секунды, а не запись

Второй тип — короткие удары: стук чашки о стол, кашель, хлопок двери, шелест бумаг прямо у микрофона, клавиатура под руками говорящего. Каждый такой звук громкий, но длится доли секунды.

Обычный шумодав их не берёт, и это не недоработка, а устройство метода: он вычитает постоянную картинку, а удар в неё не попадает. Зато удар и не портит всю запись — он накрывает ровно тот слог, на который пришёлся. Если стук совпал с числом или фамилией, потеряется число или фамилия; если пришёлся на «ну, в общем» — не потеряется ничего.

Три удара по столу — это три испорченные секунды. Чистка ради них проходит по всем сорока минутам разговора и забирает по чуть-чуть у каждой фразы. Обмен невыгодный.

Отсюда правило, которое экономит вечер: резкие звуки не лечат обработкой — их обходят. Расшифровка приходит с временем у каждой реплики, и место, где текст рвётся, находится за секунды. Дальше вы слушаете эти пять секунд, а не сорок минут.

Плеер под расшифровкой: спорный фрагмент записи с шумом переслушивается точечно, по времени реплики
Клик по реплике проигрывает именно её. Для точечных помех это и есть весь ремонт: три-четыре места, минута работы, ничего необратимого с файлом не происходит.

Эхо и гул зала: почему это почти не лечится

Пустая переговорка со стеклянной стеной, актовый зал, коридор, комната без штор и ковра — там голос доходит до микрофона дважды: прямо и отражённым от поверхностей, с задержкой в доли секунды. Это не посторонний звук, а копия вашей же речи, и вычитать её как фон не из чего: она приходит вместе с оригиналом и от него неотличима.

Вред не в громкости, а во времени. Затухающий хвост первого слога заполняет паузу перед вторым — и граница между словами, по которой их и разделяют, исчезает.

Насколько это дорого, видно по открытым испытаниям. В наборе данных REVERB запись велась в комнатах со временем реверберации примерно 0,25, 0,5 и 0,7 секунды, а микрофон стоял на 50 сантиметрах и на двух метрах; в обзоре по итогам конкурса приводится рост доли ошибочных слов примерно на 75 % в относительном выражении при переходе с гарнитуры на удалённый микрофон. То есть речь та же, помещение то же — меняется только расстояние и количество отражений.

ПомещениеКак звучит в файлеЧто реально сделать
Кабинет с мебелью и шторамиголос собранный, хвостов почти нетничего не нужно
Пустая переговорка, стекло и столзвонкий призвук, слова слипаютсяпереслушать спорное, сверить числа
Зал, холл, лестничная площадкагул, речь как из бочкивытащить смысл, дословность не восстановить
Громкая связь на всю комнатуэхо плюс наложение с динамикаискать реплики в тексте по времени

Специальные средства подавления реверберации существуют, но это не кнопка в бытовом редакторе: они работают тем лучше, чем больше микрофонов писало сцену одновременно. С единственной дорожкой из телефона, положенного на стол, ждать от них многого не стоит. Практический вывод неприятный, но честный: гул помещения — это то, что чинится на следующей записи, а не на этой.

Чужая речь и музыка со словами — это не шум

Четвёртый тип отличается от трёх предыдущих принципиально. Телевизор в соседней комнате, разговор за стеной опенспейса, объявление на вокзале, песня с текстом в кофейне — для распознавания это не помеха, а вторая речь. Оно и обойдётся с ней соответственно: постарается разобрать слова и записать их в текст.

В расшифровке это выглядит узнаваемо. Появляются фразы не по теме встречи — обрывок рекламы, строчка песни, чужая реплика из коридора. Появляются лишние говорящие: голос из телевизора получает собственную метку и живёт в документе наравне с участниками. Иногда наоборот — чужая фраза приклеивается к реплике человека, который в этот момент молчал.

Панель говорящих в расшифровке: у каждого спикера видно число сегментов — так вычисляется лишняя метка, доставшаяся чужой речи с фона
Здесь видно число реплик у каждого. Метка с тремя-четырьмя сегментами на весь часовой файл — почти всегда не человек, а голос с фона; такие подписи удаляют.

Убрать такую помеху обработкой нельзя: фильтр не различает, чей голос ему дороже, — по всем признакам и то и другое речь. Зато следы её правятся в готовом тексте, и это единственный работающий путь. Лишние метки удаляются, спорные куски переназначаются по времени; как устроено разделение говорящих и почему оно ошибается именно так, разобрано в статье про диаризацию.

Что даёт обработка по каждому типу шума

Сведём четыре типа в одну таблицу — по ней и принимается решение, стоит ли вообще открывать редактор.

Тип помехиЧто даст чисткаЧем платитеСтоит ли
Ровный гул, шипениефон уходит почти целикомлёгкое бульканье в паузахда, в один мягкий проход
Стук, кашель, хлопокщелчок приглушаетсяобработана вся запись ради секундынет, чинить точечно
Эхо, гул помещенияменяется тембр, разборчивость — нетречь глохнетнет
Чужая речь, песня с текстомничегочасть своей речи заоднонет, править текст
Музыка без слов, заставкаснимается неплохокуски на стыкахпроще вырезать участок

Одна строка тут заслуживает отдельного слова — последняя. Джингл, музыка ожидания и минута заставки перед началом встречи чистятся плохо, но их и не нужно чистить: участок вырезается целиком. Заодно это снимает вторую беду — на музыке распознавание иногда выдаёт связный текст, которого никто не произносил.

И общее правило, которое стоит держать в голове при любой настройке: ухо и распознавание ценят в записи разное. Ухо радуется тишине между фразами, а признаки, по которым различаются слова, живут в тихой части сигнала — там же, где фильтр ищет шум. Подробно эта развилка разобрана в статье про шумоподавление и качество записи.

Почему «сделать погромче» не помогает

Самая частая попытка спасения — открыть файл и поднять громкость. Логика понятная: речь тихая, шум мешает, сделаем всё громче и станет слышно. Не станет.

Усиление — это умножение всего файла на одно число. Голос вырос вдвое, шум вырос вдвое, разница между ними не изменилась ни на сколько. Разборчивость определяется именно ею.

Хуже того, у громкости есть потолок. Если поднять уровень так, что пики упрутся в максимум, вершины волны срежутся — а срезанное не восстанавливается ничем, потому что значений там больше нет. Тихая, но целая запись всегда лучше громкой и обрезанной.

Что действительно помогает вместо усиления: выравнивание по громкости, которое подтягивает тихие участки и придерживает громкие, и мягкое сжатие динамики. Разница между этим и «сделать громче» большая, а если тише всех оказался один участник, у задачи вообще другое решение — оно разобрано в статье про то, что делать, если на записи не слышно собеседника.

Предел: если голос ушёл под шум, его оттуда не достать

Это место, где стоит сказать прямо. Обработка не добавляет в файл информацию — она только по-разному распоряжается той, что есть. Если в момент записи голос был тише помехи, признаков речи в сигнале просто не осталось, и достать их не может ни редактор, ни сервис расшифровки, ни человек в наушниках.

Всё решается тем, каким было соотношение в момент записи. Первая полоса — работа на пять минут, вторая — вычитка спорных мест, третья — задача без решения.

Разборчивость речи — величина измеримая, для неё есть международный стандарт и шкала от нуля до единицы: ниже 0,30 разборчивость считается плохой, 0,60–0,75 — хорошей. Придумана шкала для залов и систем оповещения, но идея переносится буквально: у записи есть объективное качество, и оно задаётся в момент, когда микрофон стоял там, где стоял. Постобработка двигает эту величину на доли, а не на разряды.

ПерегрузДорожка выглядит сплошной полосой без просветов. Пики срезаны при записи, восстанавливать нечего.
Речь тише фонаГоворили в трёх метрах, рядом гудело. В файле есть гул, а голоса в нём почти нет.
Два голоса разомОдновременная речь не расслаивается обработкой: на этом участке два сигнала сложились в один.

Признать это выгоднее, чем бороться. Вечер, потраченный на фильтры, не вернёт того, чего в файле нет, а те же полтора часа хватило бы на то, чтобы восстановить содержание другим способом — и способ обычно находится.

Порядок действий с шумной записью

Если запись шумная, начинают не с редактора. Порядок ниже устроен так, чтобы дорогие и необратимые шаги стояли последними.

  1. Расшифруйте файл как есть, до всякой обработки. Очень часто выясняется, что текст читается: провалы приходятся на «угу» и «секундочку», а содержательные куски целы. Тогда чинить нечего.
  2. Определите тип помехи по расшифровке, а не на слух. Ровный гул даёт равномерно посредственный текст. Удары дают точечные разрывы. Гул помещения — слипшиеся слова. Чужая речь — посторонние фразы и лишние метки.
  3. Пройдите по местам, где потеря дороже всего. Суммы, даты, сроки, фамилии, номера договоров и короткое «не». В часовом разговоре таких точек десяток-полтора, у каждой стоит время.
  4. Спорное слушайте на замедленной скорости. Скорость 0,75 вытягивает окончания и различает «шестнадцатого» и «шестидесятого» надёжнее любого фильтра.
  5. Только теперь — обработка, и только против ровного фона. Один мягкий проход, оригинал в сохранности, сравнение двух расшифровок на одном фрагменте.
  6. Нечитаемое помечайте, а не додумывайте. Пометка «неразборчиво» через месяц читается как пометка, а правдоподобная догадка — как факт.
Расшифровка шумной записи по репликам: у каждой стоит говорящий и время, по которому находят место для проверки
Время рядом с каждой репликой — то, ради чего расшифровку делают до починки файла. Проверять приходится не всё подряд, а полтора десятка мест.
  1. Как естьтекст без обработки
  2. Тип шумавидно по характеру ошибок
  3. Точкичисла, имена, отрицания
  4. Документитог и договорённости

Последний шаг важнее, чем кажется. С неровной записи короткая сводка полезнее дословного текста: итог разговора, решения и договорённости собираются из смысла, а он переживает потерю отдельных слов гораздо лучше, чем цитата. Вопрос по записи возвращается с прямой цитатой и отметкой времени — и спорное место находится сразу, без перемотки.

Ответ по шумной записи с пересказом разговора: содержание вытаскивается даже там, где дословный текст рваный
Содержание устойчивее дословности. Когда часть слов потеряна, вопрос «о чём договорились по срокам» отвечается, а требование точной цитаты — уже не всегда.

Когда дешевле переспросить, чем чинить файл

Простая арифметика, о которой забывают в азарте починки. Час на фильтры плюс час на сверку текста — это два часа. Письмо на четыре строки — это четыре минуты, и в придачу к ответу вы получаете письменное подтверждение, которого у аудиозаписи нет.

  1. Из разговора нужны одна-две цифры. Переспрашивайте сразу. «Фиксирую: поставка 12 сентября, аванс 30 %, доплата по факту — поправьте, если я записал неверно» закрывает вопрос быстрее любой обработки.
  2. Участников больше двух. Разошлите то, что удалось собрать, с прямой просьбой дополнить. Люди помнят разное, и вместе они восстановят разговор точнее, чем фильтр.
  3. Запись нужна как доказательство. Тут переспрашивать бессмысленно, но и чинить нечего: спорный фрагмент либо разбирается, либо нет, и вычищенный файл в этом качестве только хуже — обработку легко предъявить как вмешательство.
  4. Разговор был длинный и без протокола. Соберите сводку по тому, что вытащилось, отправьте участникам и попросите поправить в течение дня. Молчание в этом случае работает как согласие — при условии, что вы назвали срок.

Шумная запись — не приговор тексту

Загрузите файл как есть, без предварительной чистки: Vibe2Text вернёт текст с разделением говорящих и временем у каждой реплики, а поверх — итог разговора и договорённости. Дальше вы проверяете полтора десятка мест, а не сорок минут записи.

Расшифровать запись

Бесплатный старт без карты, файлы до 4 ГБ и до 6 часов. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.

Частые вопросы

Как убрать шум из аудиозаписи, если файл уже записан?

Смотря какой шум. Постоянный гул — кондиционер, вентилятор, дорога — снимается обработкой в один мягкий проход, и речь при этом почти не страдает. Короткие удары вроде стука и кашля обработкой не берутся: они портят по секунде, и дешевле найти эти секунды по времени в расшифровке. Эхо помещения и чужие голоса не убираются вовсе. Порядок такой: сначала расшифровать файл как есть, потом решать, есть ли что чистить.

Помогает ли шумоподавление для записи разговора перед расшифровкой?

Против ровного фона — да, если делать это мягко и один раз. Против всего остального — скорее вредит: фильтр настроен на то, чтобы запись приятнее звучала, и вместе с помехой снимает тихие согласные и безударные окончания, по которым слова и различаются. Практическое правило: сначала загрузите оригинал, сравните текст, и только если он явно плох — пробуйте чистку на том же фрагменте.

Почему после чистки звука в тексте стало меньше слов?

Потому что фильтр отсекает всё тихое, а тихое в речи — это как раз шипящие, взрывные и концы слов. Первым обычно пропадает короткое «не»: оно длится доли секунды и звучит тише соседних слов, а цена потери у него максимальная — фраза меняет смысл на противоположный. Если такое случилось, вернитесь к оригиналу: из обработанного файла исходник не восстанавливается.

Что делать, если запись с шумом и расшифровка вышла рваной?

Определите по самому тексту, какая это помеха. Равномерно посредственный текст по всей записи — ровный фон. Провалы в отдельных местах — удары и щелчки. Слипшиеся слова и «речь из бочки» — эхо помещения. Посторонние фразы и лишние говорящие — чужая речь с фона. Первое лечится обработкой, второе — точечной проверкой по времени, третье и четвёртое не лечатся, но содержание из них вытаскивается.

Можно ли усилить голос, если он тонет в шуме?

Усиление поднимает голос и шум одновременно и разницы между ними не меняет — а разборчивость определяется именно разницей. Плюс появляется риск срезать пики и потерять запись окончательно. Вместо усиления работает выравнивание по громкости: оно подтягивает тихие участки, не трогая громкие. Но если голос был тише фона в момент записи, не поможет и это.

Мешает ли распознаванию телевизор или разговор за стенкой?

Мешает сильнее, чем гул кондиционера, хотя звучит тише. Для системы это не помеха, а вторая речь: она попробует её разобрать, и в тексте появятся посторонние фразы, а иногда и лишний говорящий с собственной меткой. Обработкой это не снимается — правится в готовом тексте: короткие метки удаляют, спорные реплики переназначают.

Есть ли смысл прогнать шумную запись через другой сервис?

Если помеха стирает саму речь — нет: любой инструмент получит на вход тот же файл с той же потерянной информацией. Разница между сервисами заметна на записях среднего качества и почти исчезает на плохих. Прежде чем менять инструмент, стоит проверить, что вы загружали оригинал, а не копию, пересланную через мессенджер: лишнее пережатие забирает как раз высокие частоты.

Проверено 15 августа 2026. Влияние отражений в помещении на распознавание — по материалам открытого испытания REVERB и обзору его итогов «A summary of the REVERB challenge: state-of-the-art and remaining challenges in reverberant speech processing research» (K. Kinoshita и др., EURASIP Journal on Advances in Signal Processing, 2016): комнаты со временем реверберации около 0,25, 0,5 и 0,7 секунды, микрофон на 50 и 200 сантиметрах, стационарный шум добавлялся с отношением сигнал/шум 20 дБ; там же приводится рост доли ошибочных слов примерно на 75 % в относительном выражении при переходе с гарнитуры на удалённый микрофонный массив. Шкала разборчивости речи и её градации (ниже 0,30 — плохая, 0,60–0,75 — хорошая) — по стандарту IEC 60268-16 на объективную оценку разборчивости через индекс передачи речи. Требование постоянства помехи для вычитания спектра и природа «музыкального шума» как побочного продукта такой обработки — по описаниям метода спектрального вычитания в открытых публикациях по шумоподавлению.