Форматы аудио: mp3, wav, m4a, ogg, opus, flac и amr — что брать под речь

СРАВНЕНИЕ

Форматы аудио: mp3, wav, m4a, ogg, opus, flac и amr — что брать под речь

Форматы аудио различаются не расширением, а тем, что кодек выбросил из звука. Семь форматов на одной шкале: что внутри каждого, сколько весит час речи и что из этого грузить на расшифровку.

Форматы аудио: семь расширений, которые реально приходят в работу

Одна и та же часовая встреча приезжает тремя разными файлами: диктофон на телефоне отдал m4a на сорок мегабайт, коллега выложил wav на полтора гигабайта, а из мессенджера пришло ogg на восемь. Форматы аудио различаются не «качеством вообще», а тремя вещами: что кодек выбросил из сигнала, сколько весит результат и как это отражается на распознавании речи. Разберём семь расширений, которые встречаются в работе, на одной шкале.

Расширение в имени файла называет коробку, а не звук: в m4a лежит либо сжатый AAC, либо запись без потерь, в ogg почти всегда Opus. Как устроена самая частая четвёрка и чем открывать каждое расширение на своей системе, разобрано отдельно — чем отличается mp3 от wav, m4a и ogg. Здесь важнее другое: что происходит со звуком внутри и как это меняет текст на выходе.

ФорматЧто внутриОткуда приходит чаще всегоЧас речи весит
wavнесжатый поток отсчётов, ничего не выброшенопрофессиональные рекордеры, экспорт из редактора635 МБ (44,1 кГц, стерео)
flacсжатие без потерь: тот же сигнал, упакован плотнееархивы, экспорт из монтажа, аудиоколлекциибитрейт не задаётся
mp3сжатие с потерями, стандарт из девяностыхвиртуальная АТС, диктофоны, вложения в письмах29 МБ (64 кбит/с, моно)
m4aконтейнер MPEG-4: обычно AAC, реже запись без потерьдиктофон на телефоне, встроенные рекордеры43 МБ (96 кбит/с)
oggконтейнер, внутри которого чаще всего Opusголосовые из мессенджеров, запись в браузере11 МБ (24 кбит/с)
opusтот же кодек, но под собственным расширениембраузерная запись, звук из webm-видео11 МБ (24 кбит/с)
amrречевой кодек с полосой обычного телефонастарые диктофоны, голосовая почта, кнопочные телефоны5,5 МБ (12,2 кбит/с)

Что кодек выбрасывает и почему это уже не вернуть

Разница между тремя классами не в цифрах на упаковке, а в том, что физически осталось в файле. Несжатый wav хранит все отсчёты подряд. FLAC пакует их плотнее, но так, что при распаковке получается ровно исходный сигнал. MP3, AAC, Opus и AMR выбрасывают часть звука — те детали, которые, по расчётам кодека, человек всё равно не расслышит.

Ключевое свойство третьего класса: выброшенное не восстанавливается. Перегнать mp3 обратно в wav можно за минуту, вернуть в него потерянное — нельзя ничем. Поэтому вопрос «какой формат лучше» почти всегда сводится к вопросу «в каком виде запись родилась».

Веса взяты для типовых настроек: wav 44,1 кГц стерео против mp3 64 кбит/с моно. Спуск по этой лестнице стоит дёшево, подъём невозможен.

У flac нет привычного битрейта: авторы формата прямо пишут, что битрейт здесь не задаётся, а размер получается примерно пропорционален количеству информации в исходном сигнале. На практике это значит, что ровная тихая речь ужимается сильнее музыки, но точное число заранее не назовёт никто — файл получится таким, какой сигнал.

Сколько весит час речи: от пяти мегабайт до шестисот

Вес — единственное, где разница между форматами измеряется в разах, а не в оттенках. Считается он просто: для несжатого wav это частота × разрядность × число каналов, для всего остального — битрейт × время.

Формат и настройкаЧас записиШесть часовЧто это на практике
wav 44,1 кГц, 16 бит, стерео635 МБ3,8 ГБпочти упирается в лимит на размер файла
wav 16 кГц, 16 бит, моно115 МБ691 МБразумный wav, если он вообще нужен
mp3 128 кбит/с, стерео58 МБ346 МБтиповой экспорт «на всякий случай»
mp3 64 кбит/с, моно29 МБ173 МБрабочий вариант для речи
m4a 96 кбит/с43 МБ259 МБто, что отдаёт диктофон телефона
ogg или opus, 24 кбит/с11 МБ65 МБголосовое из мессенджера
amr 12,2 кбит/с5,5 МБ33 МБпредел экономии, и это слышно
На фоне wav разница между mp3, opus и amr почти не читается — а именно её обычно и обсуждают, выбирая формат.

Отсюда практический вывод про длинные записи. Vibe2Text принимает файлы до 4 ГБ и до 6 часов, и в эти рамки укладывается всё, кроме одного случая: шестичасовая запись в wav 44,1 кГц стерео — это 3,8 ГБ, впритык к границе. Такую запись проще один раз сохранить в моно, чем воевать с загрузкой: как уменьшить размер аудиофайла — отдельный разбор с готовыми командами.

Opus, FLAC и AMR: три формата за пределами привычной четвёрки

Про mp3, wav, m4a и ogg знают все. Три оставшихся расширения приходят реже, но именно на них чаще всего спотыкаются: одно слишком экономное, второе слишком тяжёлое, третье вообще не открывается.

Opus — самый экономный и самый жадный до битов

Opus — современный кодек общего назначения: по официальному описанию он работает в диапазоне от 6 до 510 кбит/с, с частотами от 8 кГц (узкая полоса) до 48 кГц (полная) и кадрами от 2,5 до 60 миллисекунд. Для голоса разработчики рекомендуют 12 кбит/с на узкой полосе, 16–20 на широкой и 28–40 на полной — речь у него помещается туда, где mp3 уже рассыпается. Поэтому мессенджеры и шлют голосовые в ogg с Opus внутри: минута разговора весит меньше фотографии.

Обратная сторона — соблазн выкрутить экономию до предела. По нашим замерам на реальных записях встреч при агрессивном сжатии в Opus страдает не разборчивость слов, а разделение спикеров: кодек, экономящий каждый бит, стирает тембровые различия, по которым голоса и разводятся, и два участника начинают слипаться в одну метку. Слова при этом читаются, а «кто это сказал» — уже нет.

Сжатие до предела экономит мегабайты, но выносит из записи именно то, по чему различают говорящих. Слова остаются, авторство пропадает.

Вывод простой: голосовые из мессенджеров грузите как есть — они уже записаны с разумными настройками, и opus в текст переводится напрямую. А вот сами пережимать встречу в Opus на 8–12 кбит/с ради экономии места не стоит: сэкономите двадцать мегабайт и потеряете разметку говорящих.

FLAC — без потерь, но и без выигрыша для текста

FLAC сжимает звук «без какой-либо потери качества»: при распаковке получается исходный сигнал отсчёт в отсчёт. Для архива это идеально, для расшифровки нейтрально — распознаванию достаётся ровно то же, что было бы из wav, при заметно меньшем весе. Единственная особенность — совместимость: не всякий бытовой плеер и не всякая программа монтажа его открывают, зато flac в текст расшифровывается без промежуточной конвертации.

AMR — наследство старых диктофонов и голосовой почты

AMR писали для мобильной связи, и это видно по числам: восемь режимов от 4,75 до 12,2 кбит/с при частоте дискретизации 8000 Гц и кадрах по 20 миллисекунд. Восемь килогерц — это полоса обычного телефонного канала, то есть верх спектра срезан ещё при записи; более поздний AMR-WB работает на 16 кГц и звучит заметно чище. Час разговора в amr весит пять с половиной мегабайт — ровно поэтому формат до сих пор живёт в автоответчиках и диктофонах десятилетней давности.

Что с ним делать: amr в текст расшифровывается как есть, но ожидания стоит держать телефонные. Цифры, фамилии и продиктованные по буквам адреса сверяйте по записи — клик по реплике проигрывает именно её. Улучшить исходник нельзя: того, что не попало в файл при записи, в нём нет.

OpusПришёл из мессенджера — грузите как есть. Сами не пережимайте ниже 24 кбит/с: разметка говорящих ломается раньше слов.
FLACГодится и расшифровывается, но преимущества перед mp3 не даёт. Его место — архив и монтаж, а не подготовка к распознаванию.
AMRРасшифруется, но полоса телефонная. Числа и имена собственные проверяйте по таймкодам, а новые записи в этом формате не делайте.

Нужен ли WAV: формат без сжатия и что он даёт на самом деле

Wav-формат — это несжатый поток отсчётов плюс небольшой заголовок. Он не «чище» и не «лучше» сам по себе, он просто ничего не выбрасывает. Если запись изначально сделана в wav с приличной частотой, это лучший исходник, который бывает. Если же вы получили mp3 и сохранили его в wav, чтобы «поднять качество», не произошло ничего, кроме роста файла примерно в одиннадцать раз: 128 кбит/с у mp3 против 1411 у wav 44,1 кГц стерео — и ровно те же потери внутри.

Есть один случай, когда wav действительно нужен: запись идёт в монтаж, чистку или склейку нескольких дорожек. Промежуточные сохранения там делают без сжатия, чтобы не накапливать потери от каждой перекодировки. Для расшифровки этот шаг лишний — wav в текст и mp3 в текст дают одинаковый результат, если исходник один и тот же.

Карточка загрузки записи: «Перетащите файл или выберите» — MP3, MP4, WAV и другие до 4 ГБ, без конвертации
Файл кладут в окно загрузки в том виде, в каком он пришёл: mp3 из телефонии, m4a с диктофона, ogg из мессенджера. Шаг «сначала сконвертировать» из маршрута выпадает.

Что делать с экзотикой: dss, wma, 3gp, aiff и прочими

Раз в месяц приходит файл, который не открывается ничем. Обычно это одно из пяти.

  • DSS и DS2 — форматы профессиональных диктофонов, на которых работают юристы, врачи и следователи. Экономичные, с собственными полями для номера дела и автора, но проприетарные: бытовому плееру они не по зубам, нужна программа производителя или конвертер.
  • WMA — наследство старых Windows-рекордеров и офисной звукозаписи. На Windows открывается само собой, на телефоне и на Mac — уже нет.
  • 3GP и 3GA — контейнеры мобильной эпохи, внутри обычно AMR или AAC. Видеорасширение на файле, где нет картинки, пугает сильнее, чем стоит.
  • AIFF и CAF — родственники wav из мира Apple: тот же несжатый звук, другой заголовок. Вес и поведение такие же, как у wav.
  • APE, WavPack, DSD — форматы для коллекций музыки. В рабочих записях появляются почти всегда по ошибке экспорта.

Правило для всех пяти строк одно: не ищите «правильный формат», проверьте, открывается ли файл хоть чем-нибудь. Открывается — грузите как есть. Не открывается — перегоняйте один раз и сразу в тот вид, который дальше никто трогать не будет.

Развилка ровно одна, и решает её плеер, а не таблица форматов. Вторая ветка заканчивается единственной перекодировкой — и на этом всё.

Список того, что принимается без конвертации, длиннее привычной четвёрки и собран на отдельной странице: поддерживаемые форматы аудио и видео. Если исходник — видео, вытаскивать из него звук вручную тоже не требуется; когда это всё-таки нужно для других задач, есть разбор про извлечение аудио из видео.

Правило одной перекодировки

Каждое сжатие с потерями накладывается на предыдущее. Файл, который записали в m4a, переслали мессенджером (тот пережал его в свой формат), а потом сохранили в mp3 «для надёжности», прошёл три сжатия подряд — и от исходной записи в нём осталось заметно меньше, чем после любого одного из них. Отсюда правило: перекодировка допускается одна и только тогда, когда без неё нельзя.

  1. Начните с оригинала. Файл из кабинета телефонии, с карты диктофона, из панели записи встречи — а не копия, которую вам переслали в чате.
  2. Проверьте, играет ли он. Если запись открывает любой плеер, конвертация не нужна вообще: грузите как есть.
  3. Не «улучшайте» перед загрузкой. Ни перевод в wav, ни поднятие битрейта, ни шумоподавление не добавят в запись того, чего в ней нет.
  4. Если конвертировать всё-таки надо — делайте это один раз и из самого раннего файла, до всех пересылок и сохранений.
  5. Целевые настройки для речи: mp3, 64 кбит/с, 16 кГц, моно. По нашим проверкам это лучший компромисс между весом и тем, что доходит до распознавания: полоса разборчивости сохраняется целиком, а час укладывается в 29 мегабайт.
  6. Ниже не опускайтесь. Выигрыш в мегабайтах там уже копеечный, а разметка говорящих начинает рассыпаться раньше, чем слова.

Как из любого из этих форматов получить текст

Дальше всё одинаково, независимо от расширения: файл загружается как есть, а обратно приходит текст, где реплики разложены по говорящим и у каждой стоит время от начала записи. Перевод речи в текст не требует ни выбора кодека, ни предварительной подготовки — распознавание работает с тем, что внутри файла.

  1. Файлmp3, m4a, wav, ogg, opus, flac или amr
  2. Загрузкаперетаскиванием или по ссылке
  3. Расшифровкатекст со спикерами и таймкодами
  4. Документсаммари, задачи, экспорт
Готовая расшифровка записи: реплики разложены по спикерам, у каждой стоит таймкод
Результат не зависит от того, в каком расширении приехал файл. Зависит он от того, что осталось в записи к моменту загрузки.

Что действительно меняется от формата — не сам факт распознавания, а качество распознавания речи на выходе. Узкая полоса amr и предельно сжатый opus дают больше ошибок в фамилиях и числах, чем m4a с диктофона. Wav и flac преимущества перед mp3 не дают, если исходник один и тот же: они хранят то же самое, только дороже.

Панель «Спикеры»: карточка говорящего с его репликами, кнопка переименования и «Распознать имена»
Разметка говорящих — первое, что теряется при жадном сжатии, и первое, ради чего запись вообще расшифровывают. «Спикер 1» переименовывается сразу по всему документу.

И главное, что стоит унести из всего сравнения: выбирать нужно не расширение, а момент. Формат, в котором запись создана, почти всегда лучше любого, в который вы переведёте её потом.

Загрузите файл в том формате, в каком он есть

mp3 из телефонии, m4a с диктофона, ogg из мессенджера, wav из монтажа или amr со старого рекордера — Vibe2Text вернёт текст с разделением говорящих и таймкодами, а поверх него соберёт итог, решения и задачи.

Расшифровать запись

Бесплатный старт без карты, файлы до 4 ГБ и до 6 часов. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.

Частые вопросы

Какой формат аудио лучше для записи речи?

Тот, в котором пишет ваше устройство: переводить запись в другой ради качества смысла нет. Если формат выбираете вы сами, для речи оптимальны mp3, 64 кбит/с, 16 кГц, моно — полоса разборчивости сохраняется целиком, а час весит 29 мегабайт. Wav и flac имеют смысл там, где запись потом монтируют, а не расшифровывают.

Чем wav формат отличается от mp3 и когда он действительно нужен?

Wav хранит несжатый сигнал: ничего не выброшено, но час в 44,1 кГц стерео весит около 635 мегабайт против 29 у mp3 на 64 кбит/с в моно. Нужен он при монтаже и многодорожечной работе, где каждое промежуточное сохранение со сжатием добавляет свои потери. Для расшифровки преимущества нет — при одном и том же исходнике текст получается одинаковый.

Нужно ли конвертировать файл перед загрузкой на расшифровку?

Нет. mp3, m4a, wav, ogg, opus, flac, amr и видеофайлы принимаются как есть. Конвертация оправдана в одном случае: расширение настолько экзотическое, что файл не открывает ни один плеер. Тогда его один раз перегоняют в mp3 64 кбит/с, 16 кГц, моно и больше не трогают.

Влияет ли формат на разделение спикеров?

Само расширение — нет, степень сжатия — да. Тембровые различия, по которым голоса разводятся на «Спикера 1» и «Спикера 2», кодек с потерями выбрасывает одними из первых. На умеренном сжатии это незаметно, на предельно низком битрейте два участника начинают слипаться в одну метку. Поэтому запись, которую вы сжимаете сами, не стоит опускать ниже 64 кбит/с.

Почему не сжимать всё в opus, если он экономнее mp3?

Opus действительно эффективнее на низких битрейтах, и голосовые из мессенджеров приходят именно в нём — их так и грузят, как есть. Проблема начинается, когда экономию выкручивают до предела: на 8–12 кбит/с слова ещё читаются, а различие голосов уже стёрто. Если пережимаете сами, ниже 24 кбит/с уходить незачем.

Что делать, если файл не открывается ни одним плеером?

Скорее всего, это dss, ds2 или wma со старого диктофона. Сначала попробуйте плеер, который умеет больше системного, — часто вопрос закрывается на этом шаге. Если не помогло, перегоните файл один раз в mp3 64 кбит/с, 16 кГц, моно: этого хватит и для прослушивания, и для расшифровки.

Сколько весит час записи в разных форматах?

Около 635 МБ в wav 44,1 кГц стерео, 115 МБ в wav 16 кГц моно, 58 МБ в mp3 128 кбит/с, 29 МБ в mp3 64 кбит/с моно, 11 МБ в ogg или opus на 24 кбит/с и 5,5 МБ в amr. Между краями шкалы разница больше чем в сто раз — и почти никакой разницы в получившемся тексте, пока сжатие остаётся умеренным.

Проверено 14 августа 2026 по публичным спецификациям кодеков. Диапазон битрейтов Opus от 6 до 510 кбит/с, частоты от 8 кГц до 48 кГц и кадры от 2,5 до 60 мс — по официальному описанию кодека и спецификации RFC 6716; рекомендованные для голоса 12 кбит/с на узкой полосе, 16–20 на широкой и 28–40 на полной — по рекомендациям Xiph. Восемь режимов AMR от 4,75 до 12,2 кбит/с, частота дискретизации 8000 Гц, кадры по 20 мс и 16000 Гц у AMR-WB — по RFC 4867. Определение FLAC как сжатия «без какой-либо потери качества» и отсутствие задаваемого битрейта («the resulting bitrate is roughly proportional to the amount of information in the original signal») — по документации проекта FLAC. Требование к голосовым сообщениям — кодек Opus в контейнере OGG с одним аудиоканалом — по документации Telegram Bot API. Размеры файлов посчитаны из битрейта и параметров потока.