
ГАЙД
Как подготовить аудио к транскрибации: пять шагов, которые окупаются
Как подготовить аудио к транскрибации: в девяти случаях из десяти — загрузить оригинал как есть. Что из «сначала почищу» действительно окупается, что делают только ради размера файла и когда обработка обязательна.
Что сделать с записью перед загрузкой — и почему чаще всего ничего
Файл готов, палец над кнопкой загрузки, и тут появляется мысль: «сначала почищу шум, выровняю громкость, перегоню в mp3 — так же будет точнее». Мысль вредная. Ответ на вопрос, как подготовить аудио к транскрибации, в девяти случаях из десяти сводится к одному действию: загрузить оригинал как есть. Всё остальное делается не «для качества», а по конкретной причине — файл не проходит по размеру, запись длиннее шести часов, внутри видео вместо звука.
Причина простая: распознавание работает с тем, что реально дошло до микрофона. Обработка ничего не добавляет к записи — она может только убрать. Поэтому единственный по-настоящему полезный шаг делается до записи, а не после: поставить микрофон ближе к говорящим. Всё, что происходит с готовым файлом, — это либо про вес, либо про потери.
Как это выглядит на практике: запись переговоров прогнали через шумодав в бытовом редакторе — ровный гул кондиционера ушёл, а вместе с ним ушли тихие согласные на концах слов. В расшифровке появились аккуратные с виду фразы, в которых потерялись «не», возвратные «-ся» и окончания числительных: «двенадцат» вместо «двенадцатого». Шумный оригинал дал бы текст хуже на слух, но точнее по смыслу.
| Что хочется сделать | Что это даёт распознаванию | Стоит ли |
|---|---|---|
| Почистить шум перед загрузкой | срезает окончания слов вместе с шумом | нет |
| Выровнять громкость | ничего: тихую речь это не приближает | нет |
| Перегнать в wav «для качества» | ничего: потерянное не возвращается | нет |
| Поднять битрейт или частоту | ничего, кроме лишних мегабайтов | нет |
| Свести в моно и урезать битрейт | файл легче в разы, текст тот же | если не проходит по размеру |
| Вытащить дорожку из видео | то же самое без гигабайтов картинки | если видео тяжёлое |
| Отрезать лишнее в начале и конце | меньше ждать, чище отметки времени | иногда |
| Разрезать запись на части | укладывается в лимит длительности | если длиннее шести часов |

Как подготовить аудио к транскрибации: посмотреть на три числа
Вместо «обработать на всякий случай» — тридцать секунд на осмотр файла. Нужны три величины: сколько весит, сколько длится и что внутри — звук или видео. Из них выводится всё остальное.
- Размер. Свойства файла в проводнике или «Инфо» в Finder. Ориентир — 4 ГБ: меньше, значит, вопрос закрыт.
- Длительность. Видна в любом плеере. Ориентир — 6 часов; трёхчасовой семинар проходит с запасом.
- Что внутри. В VLC это «Инструменты → Информация о кодеке»: там видно, есть ли видеодорожка, какая у звука частота, сколько каналов и какой битрейт.
- Сравните с двумя порогами. Оба пройдены — грузите оригинал и не читайте дальше. Не прошли хотя бы один — ниже разобрано, что именно делать.
- Не открывайте редактор. Всё перечисленное решается одной командой или встроенным экспортом; запускать Audacity ради «посмотреть» — это лишний час и соблазн что-нибудь подкрутить.
Обратите внимание, чего в схеме нет: качества звука. Шумная запись, тихий собеседник, эхо переговорки — всё это причины переснять, а не обработать. Готовому файлу обработка добавит только потерь, и с этим ничего не поделать; что реально влияет на точность, разобрано на странице про качество распознавания.
Если файл тяжёлый: моно, 16 кГц, 64 кбит/с
Это единственное преобразование, которое стоит делать регулярно, — и делается оно ради веса и скорости загрузки, а не ради точности. Речь живёт в полосе до 8 кГц, и чтобы её записать, хватает частоты 16 кГц; второй канал в разговоре дублирует первый; 64 кбит/с в mp3 оставляют полосу шире, чем сама речь. Всё, что сверх этого, — мегабайты без слов.
| Параметр | Как обычно записалось | Во что привести | Что это даёт |
|---|---|---|---|
| Каналы | стерео | моно | вес вдвое меньше, текст тот же |
| Частота | 44,1 или 48 кГц | 16 кГц | речь укладывается целиком |
| Битрейт | 128–320 кбит/с | 64 кбит/с | час занимает около 28 МБ |
| Контейнер | wav, m4a, webm | mp3 | открывается везде, грузится быстрее |
- Одна команда на всё. ffmpeg -i запись.m4a -ac 1 -ar 16000 -b:a 64k запись.mp3 — здесь -ac 1 сводит в моно, -ar 16000 задаёт частоту, -b:a 64k — битрейт.
- Если исходник — видео. Добавьте -vn, чтобы выбросить картинку: ffmpeg -i встреча.mp4 -vn -ac 1 -ar 16000 -b:a 64k встреча.mp3.
- Без командной строки. Тот же результат даёт экспорт в любом аудиоредакторе: формат mp3, каналы — моно, частота 16000, качество 64 кбит/с.
- Проверьте результат на слух. Двадцати секунд хватает: речь должна остаться разборчивой, без «подводного» звучания.
- Оригинал не удаляйте. Пока текст не получен и не проверен, ужатая копия — рабочий файл, а не замена записи.

Если это видео: брать дорожку или грузить как есть
Видео можно загружать целиком — распознаванию нужна только звуковая дорожка, и оно возьмёт её само. Отдельный аудиофайл делают по одной причине: полуторагигабайтная запись вебинара долго уходит по слабому каналу, а звук из неё весит в сорок раз меньше. Если файл небольшой и связь нормальная, извлекать ничего не нужно.
Когда извлекать всё-таки решили, помните правило: дорожку копируют, а не пересжимают, — тогда она попадает в аудиофайл ровно такой, какой была внутри видео. Три способа с точными командами и разбор типовых ошибок — в статье как извлечь звуковую дорожку из видео. Пересжатие оправдано только в связке с прошлым разделом: когда вы сознательно приводите звук к моно и 64 кбит/с ради веса.
Отдельный случай — когда файл не проходит и после извлечения дорожки: у длинных многочасовых записей упереться можно сразу в два ограничения. Что именно не пропустило — размер, длительность или оборвавшаяся загрузка — разбирается по шагам в статье файл слишком большой для загрузки.
Если запись длинная: резать или не резать
Резать запись ради расшифровки почти никогда не нужно. Час тишины в начале стоит только времени загрузки, а посторонний разговор в середине легче пропустить глазами в тексте, чем вырезать вслепую в редакторе. Причин взяться за обрезку ровно три.
- Запись длиннее шести часов. Тут вопрос не удобства: в один файл она не помещается, и её делят на части по естественным границам — перерывам, сменам темы, концу сессии.
- В файле есть то, чего в тексте быть не должно. Разговор до начала совещания, чужая беседа после «стоп», личные пять минут в перерыве. Такое вырезают до загрузки, а не вычищают потом из готовой расшифровки.
- Нужен короткий фрагмент, а не вся запись. Когда из двухчасового заседания важны десять минут выступления, отрезанный кусок обрабатывается быстрее и читается легче.
Если резать всё-таки пришлось, две вещи экономят время потом. Первая: режьте по естественным границам — перерыв, конец сессии, смена докладчика. Кусок, оборванный на середине фразы, теряет слово и путает разметку говорящих на стыке. Вторая: называйте части так, чтобы порядок читался без открывания файлов, — «совет-2026-08-14-часть-1-из-3». Расшифровки к ним потом складываются в один документ по порядку, и не приходится вспоминать, что за чем шло.
Главное правило самой обрезки: резать копированием, без перекодирования, — тогда звук в вырезанном куске остаётся ровно тем же, что был. Точные команды для всех трёх случаев, включая вырезание из середины, — в статье как обрезать аудиозапись.

Обработка записи перед расшифровкой: чего делать не надо
Здесь собраны действия, которые кажутся заботой о качестве, а на деле забирают у распознавания часть сигнала. Все они объединены одной ошибкой: человек пытается сделать запись «приятнее на слух», хотя задача противоположная — сохранить её как есть.
- Шумоподавление «улучшайкой». Агрессивная чистка выедает окончания слов вместе с гулом. Если шум действительно тяжёлый, с ним разбираются на стороне сервиса, а не заранее: шумоподавление речи устроено так, чтобы не трогать разборчивость.
- Нормализация и «поднять громкость». Тихого собеседника на другом конце стола это не приближает: вместе с его голосом ровно так же поднимается фон.
- Перегнать сжатый файл в wav. Из mp3 получится wav, весящий в десять раз больше и содержащий ровно то же, что было в mp3. Обратной дороги у сжатия нет.
- Поднять частоту или битрейт у готовой записи. 8 кГц, пересохранённые как 48 кГц, остаются восемью килогерцами — в файле просто появляется пустой верх.
- Прогнать через несколько конвертеров подряд. Каждый шаг — новое пережатие. Три «безобидных» конвертации ощутимо портят то, что распознавать.
- Вырезать паузы автоматически. Детектор тишины охотно съедает начала фраз, а слипшиеся куски ломают и таймкоды, и разделение говорящих.
И общее правило поверх всех шести пунктов: загружайте оригинал, а не пересланную копию. Запись, прошедшая через мессенджер, уже пережата один раз чужими настройками, и это тот редкий случай, когда лишний файл в переписке стоит найти и скачать из первоисточника.
Улучшить аудио перед распознаванием: что работает на самом деле
Вопрос «как улучшить аудио перед распознаванием» почти всегда задают о готовом файле — и честный ответ такой: улучшать надо было раньше. Зато есть короткий список того, что действительно меняет результат, и почти всё в нём делается до нажатия «запись».
- До записимикрофон ближе, дверь закрыть
- Во времяне перебивать, представиться
- Послевзять оригинал файла
- Перед загрузкойпроверить размер и длительность
- Расстояние до микрофона. Полметра вместо двух — самый сильный рычаг из всех существующих, и он бесплатный.
- Один микрофон на стол, а не на каждого. Записанные врозь дорожки потом придётся сводить, и обычно это делают неудачно.
- Представление в начале. Когда участники называют себя, имена подставляются в текст вместо «Спикер 1» — это не про звук, но про читаемость итога.
- Тишина вокруг. Кондиционер, открытое окно и вентилятор ноутбука дают ровный гул, который мешает больше, чем кажется на слух.
- Оригинал вместо пересылки. Файл из первоисточника, а не из чата, — единственная «обработка», которая действительно улучшает материал.
Что делать, если запись уже сделана и она плохая, — отдельный сюжет: там работают не фильтры, а тактика чтения текста и выборочная сверка спорных мест. Разбор — в статье почему расшифровка получилась плохой.
Загрузили — что дальше
Дальше начинается то, ради чего всё затевалось. Загруженный аудиофайл превращается в текст, где реплики разложены по говорящим, а у каждой стоит время от начала записи. Форматы менять не нужно: mp3, m4a, wav, webm, ogg и видеофайлы принимаются одинаково — если сомневаетесь, какой формат вообще у вас на руках, поможет гайд по форматам аудио.

Поверх текста собирается краткое содержание с решениями и задачами, а по записи можно задавать вопросы и получать ответы с цитатами и таймкодами. Готовый документ выгружается в DOCX, PDF, TXT, Markdown, JSON, SRT или VTT — то есть подготовка нужна не файлу перед загрузкой, а тексту после неё.
И одна привычка после загрузки, которая стоит трёх минут: пройдитесь по цифрам и именам собственным. Суммы, даты, номера договоров и фамилии — те места, где ошибка дороже всего, и в записи их обычно не больше десятка. У каждой реплики стоит время, клик проигрывает именно её — десять кликов закрывают вопрос доверия ко всему документу надёжнее любой обработки файла до загрузки.

Загрузите файл как есть
Vibe2Text принимает mp3, m4a, wav, ogg, webm и видео — до 4 ГБ и до 6 часов. Расшифровка приходит с разделением по говорящим и таймкодами, а следом — краткое содержание, решения и задачи.
Расшифровать аудиофайлБесплатный старт без карты. Конвертировать, чистить и нормализовать перед загрузкой не нужно.
Частые вопросы
Как подготовить аудио к транскрибации, если запись обычная?
Никак: загрузить файл в том виде, в каком он записался. Проверить стоит только два числа — размер и длительность. Если файл меньше 4 ГБ и запись короче 6 часов, любая обработка перед загрузкой отнимет время и может ухудшить результат.
Нужно ли чистить шум перед расшифровкой?
Нет. Шумоподавление в бытовых редакторах работает грубо и вместе с гулом срезает тихие согласные на концах слов — в тексте это превращается в пропуски и неверные окончания. Распознаванию проще с честной шумной записью, чем с вылизанной.
Обработка записи перед расшифровкой: какие параметры ставить, если файл всё-таки надо ужать?
Моно, частота 16 кГц, mp3 на 64 кбит/с. Час речи занимает при этом около 28 МБ вместо 600 МБ у несжатого стерео, а текст на выходе тот же. Ниже 64 кбит/с опускаться не стоит: кодировщик начинает срезать верх полосы, и страдают шипящие.
Можно ли улучшить аудио перед распознаванием, если запись уже плохая?
Добавить в файл то, чего в нём нет, нельзя — ни фильтром, ни повышением битрейта. Рабочий подход другой: прогнать запись как есть, посмотреть текст и точечно переслушать спорные места по таймкодам. Обычно провалы приходятся на междометия, а смысловые куски читаются нормально.
Стерео или моно — что лучше для распознавания?
Для разговора, записанного одним микрофоном, разницы нет: оба канала содержат почти одно и то же, и моно вдвое легче. Стерео стоит сохранять в одном случае — когда стороны действительно записаны в разные каналы и вы хотите оставить эту раскладку как страховку при разборе спорных реплик.
Нужно ли разрезать длинную запись на части?
Только если она длиннее шести часов или в ней есть куски, которых не должно быть в тексте. Трёхчасовой семинар загружается целиком. У обрезки есть цена: все отметки времени начинают считаться от начала нового файла и перестают совпадать с прежними пометками.
Видео надо конвертировать в mp3 перед загрузкой?
Нет, видеофайл принимается как есть — звуковая дорожка берётся из него сама. Извлекать звук имеет смысл ради веса: когда запись вебинара не проходит по размеру или уходит по медленному каналу час. В этом случае дорожку копируют без пересжатия.
Проверено 14 августа 2026. Ключи -ac (число каналов), -ar (частота дискретизации), -b:a (битрейт звука) и -vn (отбросить видеодорожку) — по документации FFmpeg; команда из статьи прогнана на ffmpeg 6.1.1: на выходе mp3, 16 000 Гц, один канал, 64 кбит/с, час записи — около 28 МБ. Размер несжатого звука посчитан из формулы «частота × разрядность × число каналов»: 44,1 кГц, 16 бит, стерео дают около 600 МБ в час. Полоса широкополосной речи 50–6400 Гц при частоте 16 кГц — по рекомендации ITU-T G.722.2. Соответствие низкого битрейта и среза верхней полосы в mp3, а также рекомендованные диапазоны для речевых кодеков — по разбору в статье о битрейте и частоте, где эти значения сверены с исходным кодом открытого кодировщика LAME и спецификацией RFC 6716. Ограничения загрузки Vibe2Text — файлы до 4 ГБ и записи до 6 часов.