
ГАЙД
Какой формат аудио выбрать для расшифровки: что реально влияет на текст
Перед загрузкой хочется перегнать запись «в правильный формат» — и обычно именно это портит текст. Что решает на самом деле: частота, сжатие, каналы и происхождение файла.
Расширение файла решает меньше, чем кажется
Интервью записано, файл лежит на диске, и перед загрузкой человек уточняет в поиске, какой формат аудио лучше для расшифровки: mp3 или wav? Дальше начинается самое вредное — конвертация «в правильный формат», после которой текст выходит хуже, чем вышел бы из исходного файла. Какие шаги подготовки файла перед загрузкой действительно окупаются, разобрано отдельно.
Расширение — это имя контейнера, а не характеристика звука. Один и тот же .m4a бывает и экономно сжатой записью, и записью без потерь, которая весит раз в десять больше: в MPEG-4-контейнер с этим расширением кладут и AAC, и Apple Lossless. По значку в файловом менеджере их не различить, и по названию тоже.
Поэтому вопрос «какой формат лучше» полезнее переформулировать. На то, каким получится текст, влияют четыре вещи, и расширения среди них нет.
- Частота дискретизации. Сколько раз в секунду измерялся сигнал. Она задаёт жёсткий потолок: звуков выше половины этой частоты в файле нет вообще — ни в каком виде.
- Сжатие. Кодек с потерями выбрасывает часть сигнала навсегда. Вопрос только в том, сколько выбросили и сколько раз подряд.
- Каналы. Одна дорожка на всех, две дорожки одной сцены или отдельная дорожка на каждого участника — три принципиально разные ситуации.
- Происхождение. Оригинал из источника или копия, прошедшая через мессенджер, конвертер и «улучшайзер». Чаще всего качество теряется именно здесь.
Правильное действие почти всегда одно — не делать ничего. Оригинал в любом из ходовых форматов годится для расшифровки, а портит результат не формат, а попытка его улучшить.
Частота дискретизации: почему 8 кГц хуже 16 кГц
Цифровая запись — это измерения уровня сигнала через равные промежутки времени. Частота дискретизации говорит, сколько измерений сделано за секунду, и из неё следует простое ограничение: сохранить можно только колебания медленнее половины этой частоты. У записи 8 кГц потолок — 4 кГц, у 16 кГц — 8 кГц, у 44,1 кГц — около 22 кГц.
Речь распределена по этой шкале очень неравномерно. Основной тон голоса и гласные лежат внизу, ниже тысячи герц. Разборчивость согласных набирается примерно на 1–4 кГц. А шипящие и свистящие — «с», «ш», «ц», «ф» — это шум, основная энергия которого приходится на частоты выше 4 кГц.
Отсюда следует всё остальное. Запись 8 кГц физически не содержит того, чем «с» отличается от «ш»: распознавание достраивает разницу по контексту и на редких словах ошибается — незнакомая фамилия, продиктованный адрес, номер договора. Запись 16 кГц содержит речь целиком, и дальше расти уже некуда: выше 8 кГц полезной для распознавания информации почти нет.
Это же объясняет, почему стандарты связи десятилетиями крутятся вокруг одних и тех же чисел. Классический телефонный канал — рекомендация ITU-T G.711, «Pulse code modulation (PCM) of voice frequencies», — оцифровывает голос с частотой 8 кГц. Пришедший ему на смену широкополосный звук описан в G.722 и назван прямо в заголовке: «7 kHz audio-coding within 64 kbit/s», то есть полоса до 7 кГц при частоте 16 кГц.
У современного универсального кодека Opus то же самое разложено по полочкам. В RFC 6716 перечислены пять режимов: узкополосный — полоса 4 кГц при эффективной частоте 8 кГц, среднеполосный — 6 кГц при 12, широкополосный — 8 кГц при 16, сверхширокополосный — 12 кГц при 24 и полнополосный — 20 кГц при 48. Речь целиком укладывается в широкополосный режим; остальные два существуют ради музыки.
Практический вывод один, и он контринтуитивный: повышать частоту после записи бессмысленно. Конвертер, делающий из файла 8 кГц файл 48 кГц, не добавляет ни одного герца — он растягивает то, что есть, и увеличивает размер в шесть раз. Отрезанное отрезано на этапе записи, и никакой формат хранения этого не чинит.
Сжатие: что именно из записи выпадает
Сжатие бывает двух видов, и разница между ними принципиальная. Без потерь — FLAC, Apple Lossless: файл ужимается примерно вдвое, а при распаковке получается бит в бит исходный сигнал. С потерями — mp3, AAC, Opus, речевые кодеки телефонии: часть сигнала выбрасывается навсегда, и обратно её не достать ничем. Что это означает для конкретного расширения — от wav до amr со старого диктофона — разобрано в обзоре форматов аудио.
Что именно выбрасывают кодеки с потерями — вопрос не случайный. Они опираются на психоакустику: тихий звук рядом с громким человек всё равно не услышит, значит, хранить его подробно незачем. Для слушателя это работает отлично. Для распознавания хуже: тихие высокочастотные шумы — это и есть шипящие и свистящие, и рядом с громким гласным кодек экономит именно на них.
Практическая граница проходит не там, где спорят аудиофилы. Речь в моно на 64 кбит/с — нормальный рабочий файл, 128 кбит/с — с запасом. А вот ниже 32 кбит/с речевые кодеки экономят уже не на деталях, а на полосе: переключаются в узкополосный режим и возвращают вас к тем самым 8 кГц. Для сравнения, диапазон Opus по RFC 6716 — от 6 кбит/с для узкополосной речи до 510 кбит/с для стереомузыки, и нижняя граница этого диапазона существует не для того, чтобы там записывать интервью.
Второй источник потерь — повторное сжатие. Каждое следующее кодирование работает не с оригиналом, а с результатом предыдущего, и свои артефакты накладываются на чужие. Запись, сделанная диктофоном, пересланная голосовым сообщением и потом «сконвертированная в wav для надёжности», проходит три поколения. Последний шаг самый обидный: файл вырастает в десять раз и не приобретает ни одной новой детали.
Моно, стерео и раздельные каналы — три разные вещи
Слово «стерео» применительно к расшифровке означает четыре разные вещи, и помогает тексту только одна из них.
- Моно. Одна дорожка, в ней все голоса разом. Самый частый случай: диктофон, телефонная запись, микрофон ноутбука. Для расшифровки — нормальная рабочая база.
- Стерео как пространство. Два микрофона пишут одну сцену с небольшим разносом. Слушать приятнее, распознаванию не даёт почти ничего.
- Раздельные каналы. В каждом канале свой участник — так умеет часть телефонии и часть сервисов конференций. Вот это ценно по-настоящему: принадлежность реплики известна точно, а не выводится по тембру.
- Псевдостерео. Два одинаковых канала, скопированных друг из друга. Не добавляет ничего, только удваивает размер файла.
Есть и подвох, о котором обычно не думают: сведение стереозаписи в моно не всегда безобидно. Если микрофоны стояли на разном расстоянии от говорящего, один и тот же звук приходит в них со сдвигом по времени, и при сложении каналов часть частот взаимно гасится. Звук становится глуше и «бочковатее» — причём как раз в верхней части полосы, той самой, где живёт разборчивость. Если исходник стерео и вы не уверены, что делаете, не сводите его руками.
Обратная сторона: когда источник умеет писать каждого участника в свой канал или свой файл, это стоит включить — лучшего подарка будущему тексту не придумать. А если не умеет, ничего страшного: разделение спикеров работает и на обычной моно-дорожке, разбирая голоса по тембру и подставляя имена, если участники представились.

Откуда пришёл файл — важнее того, чем он сохранён
Один и тот же разговор может дойти до вас в пяти разных видах, и разброс качества между ними больше, чем между любыми двумя форматами из списка ниже.
- Оригинал из источника. Скачан кнопкой сохранения там, где велась запись. Одно поколение сжатия. Это цель.
- Копия из мессенджера. По документации Telegram Bot API голосовое сообщение — это .ogg с кодеком Opus: формат экономный и заточенный под передачу речи по узкому каналу. Пересланный таким образом файл получает лишнее поколение сжатия, а часто и узкую полосу.
- Запись экрана вместо записи встречи. Экранный рекордер пишет то, что вышло из динамиков: звук уже прошёл сетевой кодек, а если колонки внешние, добавляется эхо комнаты. Штатная запись конференции почти всегда лучше.
- Пересъёмка. Телефон, снимающий экран ноутбука с воспроизведением, — крайний случай. Иногда это единственный источник, но рассчитывать на аккуратный текст не стоит.
- Диктофон телефона или ноутбука. Хороший источник, если один раз заглянуть в настройки. В справке Apple по «Диктофону» на Mac выбор описан буквально: «Compressed (for lower-quality, smaller files) or Lossless (for high-quality, larger files)».

Отдельная категория — файлы, которые кто-то уже пытался спасти. Если запись прислали под именем вроде «interview_final_clean_v2.wav», стоит спросить, что с ней делали. Очень часто это сведённый в моно, пропущенный через шумодав и растянутый до 48 кГц mp3, у которого от оригинала осталась половина, зато расширение солидное.
И общее правило про архив: оригинал стоит сохранять всегда, даже если рабочей копией стала ужатая версия. Через полгода, когда понадобится переслушать спорную минуту, разница между оригиналом и «версией для отправки» окажется заметной именно на том фрагменте, ради которого всё затевалось.
Форматы по одному: что внутри и на что смотреть
Свод по ходовым форматам. Колонка «на что смотреть» — про то, что действительно стоит проверить, если файл ещё можно выбрать или перезаписать.
| Формат | Что внутри | Откуда обычно берётся | На что смотреть |
|---|---|---|---|
| WAV | Несжатый сигнал (PCM) | Диктофон в режиме качества, экспорт из редактора | Частота дискретизации: бывает и WAV на 8 кГц, и он ничем не лучше mp3 |
| FLAC, ALAC | Сжатие без потерь, примерно вдвое меньше WAV | Архивы записей, режим «lossless» на телефоне | Ничего: по содержанию это тот же оригинал |
| MP3 | Сжатие с потерями | Телефония, подкасты, пересланные записи | Битрейт: от 64 кбит/с в моно — рабочий вариант |
| M4A (AAC) | Сжатие с потерями в MPEG-4-контейнере | Диктофон телефона, запись встречи | Расширение о качестве не говорит: в том же контейнере бывает и запись без потерь |
| OGG, WEBM (Opus) | Сжатие с потерями, кодек под речь и связь | Голосовые сообщения, запись прямо в браузере | Полосу задал отправитель: на низком битрейте она узкая |
| MP4, MOV | Контейнер: видео плюс звуковая дорожка | Записи конференций, съёмка на телефон | Ничего: грузится как есть, вынимать звук не нужно |
| AMR, 3GA | Старый узкополосный речевой кодек | Голосовая почта, автоответчики, старые телефоны | 8 кГц по определению: если есть другой источник, берите его |
Какой формат аудио выбрать перед загрузкой
- Найдите оригинал. Не пересланную копию и не «версию для отправки», а файл из того места, где велась запись.
- Ничего не конвертируйте. Ни в wav, ни в mp3 «для совместимости»: аудиофайл загружается как есть, видео тоже — звук из него доставать не нужно.
- Проверьте частоту, если запись ещё предстоит сделать. 16 кГц — минимум, при котором речь попадает в файл целиком; 44,1 или 48 кГц — нормальное значение по умолчанию, больше не нужно.
- Не сводите каналы. Если участники записаны раздельно, так и оставьте: это самая ценная информация, какая бывает в аудиофайле.
- Не чистите звук. Шумодав и нормализация до загрузки чаще вредят, чем помогают, и вредят необратимо.
- Посмотрите на объём и длительность. Vibe2Text принимает файлы до 4 ГБ и до 6 часов: под это подходит и часовая встреча в несжатом виде, и многочасовая конференция.
Если исходник — видео
Видеофайл — это контейнер: картинка и звук лежат в нём отдельными дорожками. Вынимать звук вручную не нужно, и лучше этого не делать — именно на таком шаге качество теряется чаще всего, потому что в конвертере по умолчанию стоит не «как есть», а какой-нибудь mp3 на 96 кбит/с.
Звук в записи конференции обычно уже прошёл сетевой кодек, и полоса у него ближе к телефонной, чем к студийной. Делать с этим ничего не нужно — грузите как есть, а имена и термины сверьте по записи: в часовом созвоне их десяток-другой, и каждое место открывается кликом по строке.
Отдельный случай — экранная запись, где параллельно пишется микрофон и системный звук. Если ваш рекордер умеет складывать их в разные дорожки, включите: получится тот самый раздельный канал на сторону, который потом экономит массу времени на разборе, кто что сказал.
Если файл уже такой, какой есть
Половина вопросов про формат приходит уже после записи, когда переснять нельзя. Тогда вопрос меняется: не «как улучшить звук», а «где текст будет ненадёжным и что с этим делать».
Ошибки в расшифровке распределены неравномерно. Обычная связная речь читается даже с посредственного файла — контекст вытягивает. Ломается всегда одно и то же: фамилии, названия компаний, адреса, номера, суммы и даты, то есть слова, которые из контекста не восстанавливаются. В часовом разговоре таких мест обычно десяток-другой, а не сотня.
Отсюда рабочая привычка: качество распознавания проверяют не сплошным вычитыванием, а точечно. У каждой реплики стоит время от начала записи, клик по строке проигрывает именно этот фрагмент — десяток кликов закрывает вопрос доверия ко всему документу, сколько бы страниц в нём ни было.

- Оригиналфайл из источника, без конвертаций
- Загрузкааудио или видео как есть
- Текстспикеры и таймкоды
- Проверкацифры и имена по записи
Поверх текста собирается сводка: короткий итог, решения, задачи с владельцами и сроками. Формат исходника на неё не влияет, а проверять в ней стоит то же самое — имена, суммы и даты, и делать это до рассылки, а не после.

Больше всего времени экономит другое. Когда записей становится много, формат перестаёт быть разовым вопросом и превращается в настройку источника. Один раз выбранный режим качества у диктофона или включённая в сервисе конференций раздельная запись участников работают потом на каждой записи — в отличие от героических попыток вытянуть один конкретный файл. Подробнее про исходники и экспорт — в гайде по аудиоформатам.
Не выбирайте формат — загрузите оригинал
Vibe2Text принимает аудио и видео как есть и возвращает текст с разделением спикеров и таймкодами: спорную фразу можно тут же переслушать, а поверх текста собрать сводку с решениями и задачами.
Загрузить аудиофайлБесплатный старт без карты, файлы до 4 ГБ и до 6 часов. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.
Частые вопросы
Какой формат аудио лучше для распознавания речи?
Тот, в котором запись уже существует. Ходовые форматы — wav, mp3, m4a, ogg, а также видео mp4 — расшифровываются одинаково: разницу делает не расширение, а частота дискретизации, битрейт и число перекодировок. Если запись только предстоит сделать, выбирайте в настройках 16 кГц и выше и не ниже 64 кбит/с в моно; всё, что сверх этого, речи уже почти ничего не добавляет.
В каком формате сохранять запись для расшифровки?
В том, который предлагает само устройство или сервис записи. Если в настройках есть выбор качества, берите вариант без потерь или сжатие с запасом — и на этом остановитесь. Отдельная «версия для расшифровки» не нужна: чем меньше преобразований между микрофоном и загрузкой, тем лучше текст.
Нужно ли конвертировать mp3 в wav перед загрузкой?
Нет, и это самая частая лишняя работа. WAV не восстанавливает то, что mp3 уже выбросил: файл станет в десятки раз больше, а информации в нём не прибавится ни на герц. Конвертация имеет смысл только в обратную сторону — когда несжатый исходник надо куда-то передать по узкому каналу.
Влияет ли битрейт на точность расшифровки?
До определённого порога заметно, дальше почти нет. Речь в моно на 64–128 кбит/с даёт запас; ниже 32 кбит/с речевые кодеки экономят уже не на деталях, а на полосе частот, и первыми пропадают шипящие и свистящие. Поэтому голосовое сообщение из мессенджера расшифровывается хуже, чем та же речь, записанная диктофоном.
Что лучше для расшифровки — моно или стерео?
Само по себе стерео не даёт ничего: две дорожки одной и той же сцены содержат ту же речь. Ценны только раздельные каналы, где в каждом свой участник, — так пишет часть телефонии и часть сервисов конференций. Обычная моно-запись подходит полностью: говорящие разделяются по голосу. А вот сводить готовое стерео в моно вручную не стоит — при сложении каналов часть частот может погаситься.
Почему запись со старого телефона или автоответчика распознаётся хуже?
Такие записи узкополосные: телефонный тракт оцифровывает голос с частотой 8 кГц, и звуков выше 4 кГц в файле нет физически. Распознавание достраивает недостающее по контексту, поэтому обычные слова читаются нормально, а фамилии, адреса и числа приходится сверять по записи вручную. Повышать частоту конвертером бесполезно: добавить туда нечего.
Нужно ли выделять звук из видео перед загрузкой?
Нет. Видео загружается целиком, звуковая дорожка берётся из контейнера сама. Ручное извлечение обычно добавляет ещё одно сжатие, потому что в конвертере по умолчанию стоит не «как есть», а заранее выбранный битрейт.
Проверено 14 августа 2026 по публичным спецификациям и справкам производителей: параметры телефонного канала — по ITU-T G.711 «Pulse code modulation (PCM) of voice frequencies»; широкополосный звук с полосой 7 кГц в 64 кбит/с — по ITU-T G.722 «7 kHz audio-coding within 64 kbit/s»; режимы полосы и диапазон битрейтов (от 6 кбит/с для узкополосной речи до 510 кбит/с для стереомузыки; узкополосный режим — полоса 4 кГц при эффективной частоте 8 кГц, широкополосный — 8 кГц при 16 кГц, полнополосный — 20 кГц при 48 кГц) — по RFC 6716 «Definition of the Opus Audio Codec»; монофоничность профиля hands-free и пара «CVSD 8 кГц — mSBC 16 кГц» с откатом с широкой полосы на узкую — по документации Microsoft Learn о Bluetooth Classic Audio и требованиям HFP 1.8; формат голосовых сообщений (.ogg с кодеком Opus) — по документации Telegram Bot API; настройка качества записи «Compressed / Lossless» — по справке Apple «Change settings in Voice Memos on Mac»; хранение и сжатого AAC, и Apple Lossless в MPEG-4-контейнере с расширением .m4a — по описанию формата ALAC.