
ГАЙД
Шум на записи: что чинится обработкой, а что уже не спасти
Файл записан, переснять нельзя, а в нём гудит вентиляция, кто-то кашляет и работает телевизор за стенкой. Четыре типа помех с разными исходами, честная граница возможного и порядок действий, в котором обработка стоит не первой.
Шум шуму рознь: четыре типа с разными исходами
Запись уже сделана: полтора часа переговоров, вернуться и переснять невозможно. В файле — гул вентиляции, чей-то кашель, звон посуды из коридора и телевизор за стенкой. Вопрос, как убрать шум из аудиозаписи, звучит одинаково для всех четырёх помех, а вот ответ у них разный: одна снимается почти бесследно, вторая портит секунды, третья не убирается в принципе, а четвёртая вообще не шум.
Логика тут одна и стоит того, чтобы её понять один раз. Любой шумодав строит модель помехи: слушает участки без речи, запоминает, как выглядит фон, и вычитает эту картинку из всего файла. Работает приём ровно настолько, насколько помеха постоянна. Как только фон меняется от секунды к секунде — модель промахивается и начинает выгрызать куски из речи.
Ровный фон: единственный случай, когда шум из аудиозаписи реально убрать
Сюда попадает всё, что гудит непрерывно и не меняется: кондиционер, вытяжка, вентилятор ноутбука, серверная за стеной, дорога под окном, ровное шипение дешёвого микрофонного тракта. На слух это самый раздражающий шум, а технически — самый безобидный.
Причина в том, что у такой помехи неизменный спектр. Алгоритм измеряет его в паузах и вычитает во всём файле — приём старый, надёжный и как раз на постоянный фон рассчитанный. Речь при этом почти не страдает: голос заметно громче гула, и вычитание задевает его по краям, а не в середине.
И способ проверить себя, который занимает пять минут. Возьмите три минуты записи с худшим текстом, прогоните через чистку только их и положите две расшифровки рядом. Судить по тому, приятнее ли стало слушать, в этой задаче бесполезно: ухо и распознавание оценивают запись по разным признакам.
Резкие звуки: теряются секунды, а не запись
Второй тип — короткие удары: стук чашки о стол, кашель, хлопок двери, шелест бумаг прямо у микрофона, клавиатура под руками говорящего. Каждый такой звук громкий, но длится доли секунды.
Обычный шумодав их не берёт, и это не недоработка, а устройство метода: он вычитает постоянную картинку, а удар в неё не попадает. Зато удар и не портит всю запись — он накрывает ровно тот слог, на который пришёлся. Если стук совпал с числом или фамилией, потеряется число или фамилия; если пришёлся на «ну, в общем» — не потеряется ничего.
Отсюда правило, которое экономит вечер: резкие звуки не лечат обработкой — их обходят. Расшифровка приходит с временем у каждой реплики, и место, где текст рвётся, находится за секунды. Дальше вы слушаете эти пять секунд, а не сорок минут.

Эхо и гул зала: почему это почти не лечится
Пустая переговорка со стеклянной стеной, актовый зал, коридор, комната без штор и ковра — там голос доходит до микрофона дважды: прямо и отражённым от поверхностей, с задержкой в доли секунды. Это не посторонний звук, а копия вашей же речи, и вычитать её как фон не из чего: она приходит вместе с оригиналом и от него неотличима.
Насколько это дорого, видно по открытым испытаниям. В наборе данных REVERB запись велась в комнатах со временем реверберации примерно 0,25, 0,5 и 0,7 секунды, а микрофон стоял на 50 сантиметрах и на двух метрах; в обзоре по итогам конкурса приводится рост доли ошибочных слов примерно на 75 % в относительном выражении при переходе с гарнитуры на удалённый микрофон. То есть речь та же, помещение то же — меняется только расстояние и количество отражений.
| Помещение | Как звучит в файле | Что реально сделать |
|---|---|---|
| Кабинет с мебелью и шторами | голос собранный, хвостов почти нет | ничего не нужно |
| Пустая переговорка, стекло и стол | звонкий призвук, слова слипаются | переслушать спорное, сверить числа |
| Зал, холл, лестничная площадка | гул, речь как из бочки | вытащить смысл, дословность не восстановить |
| Громкая связь на всю комнату | эхо плюс наложение с динамика | искать реплики в тексте по времени |
Специальные средства подавления реверберации существуют, но это не кнопка в бытовом редакторе: они работают тем лучше, чем больше микрофонов писало сцену одновременно. С единственной дорожкой из телефона, положенного на стол, ждать от них многого не стоит. Практический вывод неприятный, но честный: гул помещения — это то, что чинится на следующей записи, а не на этой.
Чужая речь и музыка со словами — это не шум
Четвёртый тип отличается от трёх предыдущих принципиально. Телевизор в соседней комнате, разговор за стеной опенспейса, объявление на вокзале, песня с текстом в кофейне — для распознавания это не помеха, а вторая речь. Оно и обойдётся с ней соответственно: постарается разобрать слова и записать их в текст.
В расшифровке это выглядит узнаваемо. Появляются фразы не по теме встречи — обрывок рекламы, строчка песни, чужая реплика из коридора. Появляются лишние говорящие: голос из телевизора получает собственную метку и живёт в документе наравне с участниками. Иногда наоборот — чужая фраза приклеивается к реплике человека, который в этот момент молчал.

Убрать такую помеху обработкой нельзя: фильтр не различает, чей голос ему дороже, — по всем признакам и то и другое речь. Зато следы её правятся в готовом тексте, и это единственный работающий путь. Лишние метки удаляются, спорные куски переназначаются по времени; как устроено разделение говорящих и почему оно ошибается именно так, разобрано в статье про диаризацию.
Что даёт обработка по каждому типу шума
Сведём четыре типа в одну таблицу — по ней и принимается решение, стоит ли вообще открывать редактор.
| Тип помехи | Что даст чистка | Чем платите | Стоит ли |
|---|---|---|---|
| Ровный гул, шипение | фон уходит почти целиком | лёгкое бульканье в паузах | да, в один мягкий проход |
| Стук, кашель, хлопок | щелчок приглушается | обработана вся запись ради секунды | нет, чинить точечно |
| Эхо, гул помещения | меняется тембр, разборчивость — нет | речь глохнет | нет |
| Чужая речь, песня с текстом | ничего | часть своей речи заодно | нет, править текст |
| Музыка без слов, заставка | снимается неплохо | куски на стыках | проще вырезать участок |
Одна строка тут заслуживает отдельного слова — последняя. Джингл, музыка ожидания и минута заставки перед началом встречи чистятся плохо, но их и не нужно чистить: участок вырезается целиком. Заодно это снимает вторую беду — на музыке распознавание иногда выдаёт связный текст, которого никто не произносил.
И общее правило, которое стоит держать в голове при любой настройке: ухо и распознавание ценят в записи разное. Ухо радуется тишине между фразами, а признаки, по которым различаются слова, живут в тихой части сигнала — там же, где фильтр ищет шум. Подробно эта развилка разобрана в статье про шумоподавление и качество записи.
Почему «сделать погромче» не помогает
Самая частая попытка спасения — открыть файл и поднять громкость. Логика понятная: речь тихая, шум мешает, сделаем всё громче и станет слышно. Не станет.
Хуже того, у громкости есть потолок. Если поднять уровень так, что пики упрутся в максимум, вершины волны срежутся — а срезанное не восстанавливается ничем, потому что значений там больше нет. Тихая, но целая запись всегда лучше громкой и обрезанной.
Что действительно помогает вместо усиления: выравнивание по громкости, которое подтягивает тихие участки и придерживает громкие, и мягкое сжатие динамики. Разница между этим и «сделать громче» большая, а если тише всех оказался один участник, у задачи вообще другое решение — оно разобрано в статье про то, что делать, если на записи не слышно собеседника.
Предел: если голос ушёл под шум, его оттуда не достать
Это место, где стоит сказать прямо. Обработка не добавляет в файл информацию — она только по-разному распоряжается той, что есть. Если в момент записи голос был тише помехи, признаков речи в сигнале просто не осталось, и достать их не может ни редактор, ни сервис расшифровки, ни человек в наушниках.
Разборчивость речи — величина измеримая, для неё есть международный стандарт и шкала от нуля до единицы: ниже 0,30 разборчивость считается плохой, 0,60–0,75 — хорошей. Придумана шкала для залов и систем оповещения, но идея переносится буквально: у записи есть объективное качество, и оно задаётся в момент, когда микрофон стоял там, где стоял. Постобработка двигает эту величину на доли, а не на разряды.
Признать это выгоднее, чем бороться. Вечер, потраченный на фильтры, не вернёт того, чего в файле нет, а те же полтора часа хватило бы на то, чтобы восстановить содержание другим способом — и способ обычно находится.
Порядок действий с шумной записью
Если запись шумная, начинают не с редактора. Порядок ниже устроен так, чтобы дорогие и необратимые шаги стояли последними.
- Расшифруйте файл как есть, до всякой обработки. Очень часто выясняется, что текст читается: провалы приходятся на «угу» и «секундочку», а содержательные куски целы. Тогда чинить нечего.
- Определите тип помехи по расшифровке, а не на слух. Ровный гул даёт равномерно посредственный текст. Удары дают точечные разрывы. Гул помещения — слипшиеся слова. Чужая речь — посторонние фразы и лишние метки.
- Пройдите по местам, где потеря дороже всего. Суммы, даты, сроки, фамилии, номера договоров и короткое «не». В часовом разговоре таких точек десяток-полтора, у каждой стоит время.
- Спорное слушайте на замедленной скорости. Скорость 0,75 вытягивает окончания и различает «шестнадцатого» и «шестидесятого» надёжнее любого фильтра.
- Только теперь — обработка, и только против ровного фона. Один мягкий проход, оригинал в сохранности, сравнение двух расшифровок на одном фрагменте.
- Нечитаемое помечайте, а не додумывайте. Пометка «неразборчиво» через месяц читается как пометка, а правдоподобная догадка — как факт.

- Как естьтекст без обработки
- Тип шумавидно по характеру ошибок
- Точкичисла, имена, отрицания
- Документитог и договорённости
Последний шаг важнее, чем кажется. С неровной записи короткая сводка полезнее дословного текста: итог разговора, решения и договорённости собираются из смысла, а он переживает потерю отдельных слов гораздо лучше, чем цитата. Вопрос по записи возвращается с прямой цитатой и отметкой времени — и спорное место находится сразу, без перемотки.

Когда дешевле переспросить, чем чинить файл
Простая арифметика, о которой забывают в азарте починки. Час на фильтры плюс час на сверку текста — это два часа. Письмо на четыре строки — это четыре минуты, и в придачу к ответу вы получаете письменное подтверждение, которого у аудиозаписи нет.
- Из разговора нужны одна-две цифры. Переспрашивайте сразу. «Фиксирую: поставка 12 сентября, аванс 30 %, доплата по факту — поправьте, если я записал неверно» закрывает вопрос быстрее любой обработки.
- Участников больше двух. Разошлите то, что удалось собрать, с прямой просьбой дополнить. Люди помнят разное, и вместе они восстановят разговор точнее, чем фильтр.
- Запись нужна как доказательство. Тут переспрашивать бессмысленно, но и чинить нечего: спорный фрагмент либо разбирается, либо нет, и вычищенный файл в этом качестве только хуже — обработку легко предъявить как вмешательство.
- Разговор был длинный и без протокола. Соберите сводку по тому, что вытащилось, отправьте участникам и попросите поправить в течение дня. Молчание в этом случае работает как согласие — при условии, что вы назвали срок.
Шумная запись — не приговор тексту
Загрузите файл как есть, без предварительной чистки: Vibe2Text вернёт текст с разделением говорящих и временем у каждой реплики, а поверх — итог разговора и договорённости. Дальше вы проверяете полтора десятка мест, а не сорок минут записи.
Расшифровать записьБесплатный старт без карты, файлы до 4 ГБ и до 6 часов. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.
Частые вопросы
Как убрать шум из аудиозаписи, если файл уже записан?
Смотря какой шум. Постоянный гул — кондиционер, вентилятор, дорога — снимается обработкой в один мягкий проход, и речь при этом почти не страдает. Короткие удары вроде стука и кашля обработкой не берутся: они портят по секунде, и дешевле найти эти секунды по времени в расшифровке. Эхо помещения и чужие голоса не убираются вовсе. Порядок такой: сначала расшифровать файл как есть, потом решать, есть ли что чистить.
Помогает ли шумоподавление для записи разговора перед расшифровкой?
Против ровного фона — да, если делать это мягко и один раз. Против всего остального — скорее вредит: фильтр настроен на то, чтобы запись приятнее звучала, и вместе с помехой снимает тихие согласные и безударные окончания, по которым слова и различаются. Практическое правило: сначала загрузите оригинал, сравните текст, и только если он явно плох — пробуйте чистку на том же фрагменте.
Почему после чистки звука в тексте стало меньше слов?
Потому что фильтр отсекает всё тихое, а тихое в речи — это как раз шипящие, взрывные и концы слов. Первым обычно пропадает короткое «не»: оно длится доли секунды и звучит тише соседних слов, а цена потери у него максимальная — фраза меняет смысл на противоположный. Если такое случилось, вернитесь к оригиналу: из обработанного файла исходник не восстанавливается.
Что делать, если запись с шумом и расшифровка вышла рваной?
Определите по самому тексту, какая это помеха. Равномерно посредственный текст по всей записи — ровный фон. Провалы в отдельных местах — удары и щелчки. Слипшиеся слова и «речь из бочки» — эхо помещения. Посторонние фразы и лишние говорящие — чужая речь с фона. Первое лечится обработкой, второе — точечной проверкой по времени, третье и четвёртое не лечатся, но содержание из них вытаскивается.
Можно ли усилить голос, если он тонет в шуме?
Усиление поднимает голос и шум одновременно и разницы между ними не меняет — а разборчивость определяется именно разницей. Плюс появляется риск срезать пики и потерять запись окончательно. Вместо усиления работает выравнивание по громкости: оно подтягивает тихие участки, не трогая громкие. Но если голос был тише фона в момент записи, не поможет и это.
Мешает ли распознаванию телевизор или разговор за стенкой?
Мешает сильнее, чем гул кондиционера, хотя звучит тише. Для системы это не помеха, а вторая речь: она попробует её разобрать, и в тексте появятся посторонние фразы, а иногда и лишний говорящий с собственной меткой. Обработкой это не снимается — правится в готовом тексте: короткие метки удаляют, спорные реплики переназначают.
Есть ли смысл прогнать шумную запись через другой сервис?
Если помеха стирает саму речь — нет: любой инструмент получит на вход тот же файл с той же потерянной информацией. Разница между сервисами заметна на записях среднего качества и почти исчезает на плохих. Прежде чем менять инструмент, стоит проверить, что вы загружали оригинал, а не копию, пересланную через мессенджер: лишнее пережатие забирает как раз высокие частоты.
Проверено 15 августа 2026. Влияние отражений в помещении на распознавание — по материалам открытого испытания REVERB и обзору его итогов «A summary of the REVERB challenge: state-of-the-art and remaining challenges in reverberant speech processing research» (K. Kinoshita и др., EURASIP Journal on Advances in Signal Processing, 2016): комнаты со временем реверберации около 0,25, 0,5 и 0,7 секунды, микрофон на 50 и 200 сантиметрах, стационарный шум добавлялся с отношением сигнал/шум 20 дБ; там же приводится рост доли ошибочных слов примерно на 75 % в относительном выражении при переходе с гарнитуры на удалённый микрофонный массив. Шкала разборчивости речи и её градации (ниже 0,30 — плохая, 0,60–0,75 — хорошая) — по стандарту IEC 60268-16 на объективную оценку разборчивости через индекс передачи речи. Требование постоянства помехи для вычитания спектра и природа «музыкального шума» как побочного продукта такой обработки — по описаниям метода спектрального вычитания в открытых публикациях по шумоподавлению.