Битрейт и частота дискретизации для речи: где проходит граница

ГАЙД

Битрейт и частота дискретизации для речи: где проходит граница

Герцы решают, какие звуки попадут в файл, килобиты — сколько от них останется после сжатия. Где проходит граница, за которой в тексте начинают сыпаться цифры и фамилии.

Два числа в настройках любого рекордера

Перед интервью человек открывает настройки диктофона и видит два списка: частота дискретизации и битрейт. В одном — 8000, 16000, 22050, 44100, 48000 Гц. В другом — 32, 64, 128, 256 кбит/с. Что из этого выбрать для записи речи, нигде не написано, а от выбора зависит, будут ли в готовом тексте правильные фамилии, суммы и даты.

Числа отвечают за разное. Частота дискретизации задаёт потолок: какие звуки вообще попадут в файл. Битрейт — сколько подробностей от попавшего останется после сжатия. Второе не чинит первое: 320 кбит/с поверх записи на 8 кГц дадут большой файл с тем же телефонным звуком, который потом придётся уменьшать перед загрузкой.

  • Частота дискретизации, кГц. Сколько раз в секунду измеряется сигнал. Разделите пополам — получите верхнюю границу спектра, которую файл способен сохранить. Выше этой границы в записи нет ничего.
  • Битрейт, кбит/с. Сколько бит в секунду тратится на хранение. У сжатых форматов это ещё и распоряжение кодировщику: уложись в столько, а чем пожертвовать — решай сам.
  • Разрядность, бит. Третье число с того же экрана, 16 или 24. К полосе частот отношения не имеет, отвечает за запас по громкости.

Частота дискретизации: потолок, который потом не поднять

Число в герцах — это сколько замеров сигнала преобразователь успевает сделать за секунду. Отсюда жёсткое ограничение, известное как теорема Котельникова, она же Найквиста—Шеннона: по цепочке отсчётов восстанавливаются только колебания медленнее половины частоты замеров.

Потолок — ровно половина частоты дискретизации, и поднять его потом нечем. Средняя строка и есть рабочий минимум для речи: восьми килогерц хватает на шипящие.

Арифметика простая. 8 кГц — потолок 4 кГц. 16 кГц — потолок 8 кГц. 44,1 кГц — около 22 кГц. И главное: то, что выше потолка, не «звучит тише» и не «теряет в качестве». Его в файле нет, и взять его неоткуда.

Речь занимает эту шкалу неравномерно, и полезное для текста сидит в верхней половине. Внизу, до 300 Гц, — основной тон: по нему узнают голос, но не слова. До 3 кГц лежат гласные и форманты, они отвечают за «на кого похоже», а не за «что сказано». Смысл несут согласные, и они забираются выше: взрывные и носовые опознаются к 4 кГц, а глухие «с», «ш», «щ», «ф» — уже не тон, а шум, растянутый от 4 кГц вверх.

Поэтому 16 кГц и оказываются рабочим минимумом: восьмикилогерцовой полосы хватает, чтобы «с» и «ш» остались двумя разными звуками, а не одним смазанным. Всё, что ниже, распознаванию приходится угадывать по соседним словам — и на редком слове угадывание промахивается. Всё, что выше, добавляет к записи диапазон, в котором речи попросту нет.

Низкий битрейт бьёт туда же, куда низкая частота, — в полосу 4–8 кГц, где различаются шипящие, а с ними фамилии и числительные.

Тогда откуда взялись 44,1 кГц, которые стоят по умолчанию почти везде? Из видеокассеты. В конце 1970-х цифровой звук писали на видеомагнитофон через PCM-адаптер, и частоту подбирали так, чтобы отсчёты ложились на строки видеосигнала: 294 строки × 50 полей × 3 отсчёта = 44 100 у PAL, столько же у чёрно-белого NTSC — 245 × 60 × 3. Число подошло обоим стандартам, попало в компакт-диск и осталось навсегда.

48 кГц пришли из кино и видеопроизводства. Для речи обе цифры избыточны — не вредны, просто избыточны: разница с 16 кГц уходит целиком в размер файла.

Битрейт: сколько подробностей осталось внутри потолка

У несжатого файла битрейт не выбирают — он получается сам: частота × разрядность × число каналов. Запись 16 кГц, 16 бит, моно — это 256 кбит/с, и решать тут нечего. Настройка «битрейт» появляется там, где включается сжатие с потерями, и означает она бюджет: уложись в столько бит, а чем пожертвовать — твоё дело.

У несжатого файла битрейт не выбирают — он складывается сам из трёх верхних чисел. Выбор появляется только там, где включается сжатие.

Решение принимается по модели слуха: громкий звук маскирует соседние тихие, слушатель их всё равно не выделит — значит, точность в этих местах можно занизить. Приём безотказный для ушей и обидный для текста: тихий высокочастотный шум рядом с громким гласным — это и есть шипящая согласная, и экономят первым делом на ней.

Но раньше психоакустики срабатывает вещь куда более грубая. Когда битов совсем мало, кодировщик не мучается с моделью слуха, а просто отрезает верх полосы фильтром — до всякого анализа. В открытом mp3-кодировщике LAME, который встроен во множество конвертеров и аудиоредакторов, соответствие битрейта и среза лежит прямо в исходном коде: 24 кбит/с — срез на 3,9 кГц, 32 — на 5,5, 48 — на 7,5, 64 — на 11, 96 — на 15,1, 128 — на 17 кГц.

Отсюда граница — не вкусовая, а арифметическая. 64 кбит/с в моно оставляют полосу до 11 кГц: речь помещается целиком, с запасом в три килогерца. 48 подбираются к верхушке шипящих, 32 режут по согласным, а 24 дают телефонный звук — что бы ни стояло в настройке частоты.

Битрейт mp3, моноЧто остаётся от полосыЧто это значит для текста
128 кбит/сдо 17 кГцречь целиком, запас двукратный
96 кбит/сдо 15,1 кГцречь целиком, запас большой
64 кбит/сдо 11 кГцречь целиком, рабочий минимум
48 кбит/сдо 7,5 кГцверхушка шипящих срезана, редкие слова под вопросом
32 кбит/сдо 5,5 кГцшипящих нет, числа и фамилии придётся сверять
24 кбит/сдо 3,9 кГцтелефонная полоса, сверять почти всё
Граница проходит между 64 и 48 кбит/с: до неё речь помещается целиком, после — из неё пропадают шипящие, а с ними фамилии и числительные.

Второе: битрейт без названия кодека не значит ничего. Телефонный канал по рекомендации ITU-T G.711 тратит 64 кбит/с на полосу 3,4 кГц. Кодек Opus по спецификации RFC 6716 укладывает ту же речь с полосой 8 кГц в 16–20 кбит/с — вчетверо экономнее. Одно число в двух форматах означает разное качество.

Речевые кодеки связи выжимают ещё сильнее, потому что заточены под одну задачу. AMR-WB, он же ITU-T G.722.2 и «HD Voice» в мобильных сетях, работает в девяти режимах от 6,6 до 23,85 кбит/с при частоте 16 кГц и держит полосу 50–6400 Гц. Ориентир простой: даже кодек, вылизанный под минимальный битрейт, ниже 6,6 кбит/с не спускается.

Отсюда рабочие пары. mp3 — от 64 кбит/с в моно. AAC при том же битрейте держит полосу шире, но порог там зависит от кодировщика. Opus — от 24 кбит/с, с запасом к рекомендованным 16–20. Ниже этих значений в любом формате теряются не подробности, а ширина полосы.

Где именно ломается текст

Ошибки садятся в текст не ровным слоем. Беглая связная речь выдерживает и посредственный файл: соседние слова подсказывают друг друга, и фраза собирается даже там, где половина звуков смазана. Проваливается то, у чего подсказок нет.

  • Фамилии и названия. «Шишкин» и «Сысоев» различаются ровно тем куском спектра, который срезают первым.
  • Числительные. «Пятнадцать» и «пятьдесят», «шестнадцатого» и «шестидесятого» отличаются окончанием — коротким, тихим и высокочастотным.
  • Продиктованное по буквам. Адрес, номер договора, серия документа: «эс» и «эф» в узкой полосе почти неразличимы.
  • Термины и англицизмы. Слово, которого в этом месте не ждут, контекстом не подстрахуется — и вместо него появляется похожее по звучанию русское.
Ошибки распределяются неровно. Беглую фразу соседние слова вытягивают, а имя, сумму и адрес подсказать нечем — именно они и попадают в список на сверку.

Поэтому граница качества меряется не процентами, а объёмом сверки. С полосой 8 кГц в часовой записи проверяют десяток мест. С телефонной полосой 3,4 кГц — все числа и все имена подряд, а это уже другая работа по времени.

Сверка при этом не означает сплошного вычитывания. Каждая реплика подписана временем, нажатие на строку поднимает ровно тот кусок записи, и десяток нажатий закрывает вопрос доверия к документу любой длины. Что проверять в первую очередь — в описании качества распознавания.

Реплики разговора с подписями спикеров и временем у каждой строки — точечная сверка цифр
Проверка спорного числа занимает секунды: нашли строку, нажали, услышали. Чем уже полоса у исходника, тем длиннее список строк, которые придётся так открыть.

Во что 44 кГц обходятся в мегабайтах

Привычка «поставить получше на всякий случай» упирается в арифметику. У несжатой записи размер считается в одно действие: частота × разрядность × каналы. Час речи выходит так.

НастройкаБитрейтЧас записиШесть часов
WAV 16 кГц / 16 бит / моно256 кбит/с115 МБ690 МБ
WAV 44,1 кГц / 16 бит / моно706 кбит/с318 МБ1,9 ГБ
WAV 44,1 кГц / 16 бит / стерео1411 кбит/с635 МБ3,8 ГБ
WAV 48 кГц / 24 бита / стерео2304 кбит/с1,04 ГБ6,2 ГБ
MP3 128 кбит/с128 кбит/с58 МБ346 МБ
MP3 64 кбит/с, моно64 кбит/с29 МБ173 МБ
Opus 24 кбит/с24 кбит/с11 МБ65 МБ

Между первой и третьей строкой — пять с половиной раз, и весь этот объём хранит частоты, которых в речи нет. Заодно видно, где кончается запас: шесть часов в 48 кГц, 24 бита, стерео весят 6,2 ГБ и в ограничение 4 ГБ не проходят, а та же встреча в 16 кГц моно — 690 МБ.

Отсюда правило для длинных записей: если пишете несжатым звуком, загляните в настройки заранее. Сжатие на 64–128 кбит/с закрывает вопрос совсем — час укладывается в 30–60 МБ, а речь остаётся целой.

Загрузка записи на расшифровку: приём файлов MP3, MP4, WAV и других размером до 4 ГБ
Верхняя граница у приёмника щедрая: 4 ГБ и шесть часов на файл. Даже несжатая многочасовая запись в неё укладывается — «поставить получше» упирается в место на устройстве, а не в загрузку.

Что ставить: диктофон, созвон, микрофон

Три ситуации, в которых настройки решают разное. У диктофона вы управляете всем, в созвоне — почти ничем, а у микрофона важнее чисел оказывается уровень. Чем писать в каждом из случаев — разобрано отдельно.

Настройки стоит трогать там, где они ваши. В созвоне числа выбирает сервис, и выигрыш даёт не битрейт, а способ записи и микрофон.

Диктофон — телефонный или отдельный

  • Если выбор словами, а не числами. «Высокое качество», «HQ», «без потерь» — это верх списка, где битрейт заведомо выше 64 кбит/с. «Экономия места», «для диктовки», «long play» — низ, где стоят 24–32 кбит/с и узкая полоса. Для интервью берите верх, для планёрки достаточно середины.
  • Частота. Стоящие по умолчанию 44,1 или 48 кГц оставьте как есть — они безопасны. 16 кГц выбирайте осознанно, когда впереди многочасовая запись и важен размер.
  • Битрейт. Не ниже 64 кбит/с в моно. Это единственное число со всего экрана, которое действительно стоит проверить перед важной записью.
  • Каналы. Моно, если пишете одним микрофоном: второй канал будет копией первого и просто удвоит файл.
  • Шумоподавление и «усиление голоса» в самом рекордере выключите. Они настроены на человеческое ухо и срезают окончания слов вместе с шумом — необратимо, ещё до сохранения файла.
  • Расстояние важнее настроек. Диктофон посреди стола на шесть человек проиграет любому телефону, положенному ближе к говорящим и подальше от проектора и кондиционера.

Созвон

Здесь битрейт вам никто не отдаст: его выбирает сервис и меняет на ходу под состояние сети. Управлять можно другим, и это другое влияет сильнее.

Тихую запись вытягивать нечем: усиление поднимет вместе с голосом весь шум комнаты. Перегруз необратим вовсе — у волны срезана верхушка.
  • Пишите штатной записью встречи, а не рекордером экрана. Экранная запись берёт звук уже после того, как он вышел из динамиков, и добавляет к сетевому кодеку акустику комнаты.
  • Не используйте беспроводную гарнитуру как микрофон. Как только наушники начинают ещё и слушать вас, звук уходит в разговорный профиль связи с потолком 16 кГц, а нередко и 8. Слушать в них можно, писать — встроенным микрофоном или проводной гарнитурой.
  • Загляните в «режим для музыки», если он есть. У Zoom он поднимает кодек до 48 кГц и 96 кбит/с в моно, 192 в стерео, и временно отключает шумоподавление. В тихой комнате это чистый выигрыш, в шумной — размен.
  • Проверьте уровень до начала, а не на третьей минуте. Далёкий тихий голос в записи не чинится ничем: усиление поднимет вместе с ним весь шум комнаты.

Микрофон и звуковая карта

  • Стоящие по умолчанию 44,1 или 48 кГц и 24 бита оставьте как есть. Повышать их незачем: полосу речи это не расширит, а вес удвоит.
  • Уровень важнее чисел. Держите пики в районе −12…−6 dBFS: тише — вылезет собственный шум тракта, громче — перегруз. Перегруз необратим, у волны просто срезана верхушка, и никакая обработка её не вернёт.
  • Один микрофон на человека лучше одного на стол. А если источник умеет писать участников в отдельные каналы — включите: точная принадлежность реплики полезнее любого битрейта.
  • Поп-фильтр и ладонь расстояния убирают взрывные «п» и «б», которые иначе выглядят в записи как щелчки и съедают соседние слова.
ДиктофонРежим качества или 64+ кбит/с в моно, частоту не трогать, шумодав в приложении выключить, положить ближе к людям.
СозвонШтатная запись встречи, проводной микрофон вместо беспроводной гарнитуры, уровень проверен до начала.
МикрофонДефолт 48 кГц и 24 бита, пики около −12 dBFS, отдельный микрофон на говорящего.

Третье число: разрядность

16 или 24 бита — соседняя настройка, которую регулярно путают с битрейтом. Разрядность говорит, насколько мелкими ступеньками меряется уровень сигнала, и отвечает не за полосу, а за динамический диапазон: около 6 дБ на бит. У 16 бит потолок — примерно 98 дБ, у 24 — около 146, причём реальные преобразователи упираются в 123 дБ.

Речи хватает 16 бит с запасом: разница между шёпотом и смехом в переговорной до 98 дБ не дотягивает. 24 бита берут не ради «чистоты звучания», а как страховку: с ними можно писать тише и не бояться, что внезапный смех уйдёт в перегруз.

И главное: разрядность не расширяет полосу. Файл 8 кГц в 24 битах остаётся телефонным — просто аккуратнее измеренным. Если из трёх чисел проверять только одно, проверяйте частоту дискретизации.

Если файл уже записан

Чаще всего оба числа выясняют задним числом, когда переснимать уже нечего. Тогда задача другая: понять, чего ждать от текста, и не убавить то, что осталось.

  1. Посмотрите два числа. Частота и битрейт в свойствах файла сразу говорят, будет текст надёжным или придётся сверять каждое имя.
  2. Не конвертируйте вверх. Файл 8 кГц, растянутый до 48, не приобретает ни одного герца — только вес. То же и с mp3, пересохранённым в wav: информации не прибавится, а размер вырастет в разы.
  3. Не пережимайте ещё раз. Второй проход кодировщика считает свой бюджет уже от обрезанной полосы и добавляет собственные артефакты к чужим. Соседние грабли — в статье про выбор формата аудио.
  4. Грузите как есть. mp3, m4a, wav, ogg и видео принимаются без подготовки — вынимать звуковую дорожку из видео не нужно.
  5. Сверяйте точечно. Числа, фамилии и даты — нажатием на строку; остальное читается как обычный текст. Список таких мест тем короче, чем шире была полоса у исходника.

Поверх расшифровки собирается сводка: короткий итог, решения и задачи с владельцами и сроками. Настройки исходника на её структуру не влияют. Влияют они на другое — на то, сколько пунктов в ней придётся открыть и переслушать, прежде чем отправлять её людям.

Короткий пересказ записи, собранный ИИ по её содержанию, с именами собеседников и цифрами
Выводы держатся крепче дословного текста: пропавшее окончание редко меняет смысл. А вот суммы и фамилии в них стоит сверить с записью — от настроек исходника зависит, сколько таких мест наберётся.
  1. Настройкадва числа перед записью
  2. Записьоригинал без перекодировок
  3. Расшифровкаспикеры и таймкоды
  4. Сверкачисла и имена по записи

Настраивают это один раз. Режим, выбранный в диктофоне сегодня, будет стоять и на следующей записи, и на всех после неё; неудачный файл, наоборот, вытягивают каждый раз заново. Общий свод по исходникам, форматам и экспорту — в гайде по аудиоформатам.

Проверьте на своей записи

Проще один раз посмотреть на результат, чем спорить о числах. Загрузите запись прямо с диктофона или из сервиса встреч — Vibe2Text вернёт текст, разложенный по говорящим, с временем у каждой реплики; спорное число слышно нажатием на строку.

Загрузить запись

Без карты. Файлы до 4 ГБ и до 6 часов, выгрузка в DOCX, PDF, SRT и ещё четыре формата.

Частые вопросы

Какой битрейт нужен для распознавания речи?

Для mp3 в моно — от 64 кбит/с: типовой кодировщик оставляет при этом полосу до 11 кГц, и речь помещается целиком. На 48 кбит/с срез опускается до 7,5 кГц и задевает шипящие, на 32 — до 5,5 кГц, а это уже по живому. У Opus порог ниже: спецификация рекомендует 16–20 кбит/с, так что 24 идут с запасом. Выше 128 кбит/с прибавляется только размер файла.

Какая частота дискретизации нужна для транскрибации?

16 кГц — рабочий минимум: половина от этого числа, 8 кГц, и есть верх речевого спектра. Дефолтные 44,1 и 48 кГц не вредят, просто пишут диапазон, в котором голоса нет. А вот 8 кГц в настройке дают потолок 4 кГц: глухие «с» и «ш» в такой полосе становятся одним звуком, и различать их приходится по смыслу фразы.

16 кГц или 44 кГц — что выбрать для записи разговора?

Обе годятся, и текст выйдет одинаковым. 16 кГц вмещают речь целиком, а 44,1 кГц — наследство компакт-диска, которому это число досталось от способа записывать звук на видеоленту. Разница видна только в весе: час несжатой записи в 16 кГц моно — около 115 МБ, в 44,1 кГц стерео — около 635 МБ. Для длинной записи 16 кГц выбирают осознанно, для короткой оставляют как есть.

Какое качество записи нужно для расшифровки?

Достаточно 16 кГц и 64 кбит/с в моно. Дальше прибавку даёт не техника, а обстановка: микрофон ближе к говорящим, выключенный в рекордере шумодав и проверенный до старта уровень меняют текст сильнее, чем любое повышение чисел в настройках.

Поможет ли повысить битрейт или частоту у уже записанного файла?

Нет. Пересчёт из 8 кГц в 48 не рождает ни одной новой частоты: алгоритм достраивает промежуточные отсчёты между теми, что уже есть, и получает прежний сигнал, записанный вшестеро большим числом цифр. С битрейтом так же: mp3 на 32 кбит/с, пересохранённый в 320, сохранит те же обрезанные 5,5 кГц. Обрезка случается один раз — в момент записи.

16 или 24 бита — что ставить?

16 бит — это около 98 дБ динамического диапазона, куда переговорная не дотягивает. 24 бита берут как страховку от перегруза: с ними пишут с запасом по громкости. На полосу разрядность не влияет — запись 8 кГц в 24 битах остаётся телефонной.

Почему голосовое сообщение расшифровывается хуже, чем та же речь с диктофона?

Мессенджер жмёт речь под узкий канал, а бюджет в несколько десятков килобит кодек экономит не на подробностях, а на ширине полосы: сначала уходит всё выше 7–8 кГц, потом всё выше 4 кГц. Общий смысл фраз это переживает, адреса и номера — проверяются по таймкодам. Если тот же разговор параллельно писал диктофон, берите файл диктофона.

Проверено 14 августа 2026 по открытым спецификациям, исходному коду кодировщиков и справкам производителей. Телефонный канал — 64 кбит/с на полосу 300–3400 Гц при дискретизации 8 кГц: рекомендация ITU-T G.711. Девять режимов AMR-WB от 6,60 до 23,85 кбит/с при частоте 16 кГц и полосе 50–6400 Гц: ITU-T G.722.2. Режимы полосы Opus (4 кГц при частоте 8 кГц, 8 кГц при 16 кГц, 20 кГц при 48 кГц), общий диапазон 6–510 кбит/с и рекомендации 16–20 кбит/с на широкополосную речь и 28–40 на полнополосную: RFC 6716. Соответствие битрейта и частоты среза (24 кбит/с → 3900 Гц, 32 → 5500, 48 → 7500, 64 → 11 000, 96 → 15 100, 128 → 17 000, далее до 320 → 20 500) — функция optimum_bandwidth в исходниках кодировщика LAME. Число 44 100 получено из строчной структуры видеосигнала на PCM-адаптерах (294 × 50 × 3 для PAL и 245 × 60 × 3 для чёрно-белого NTSC) — по описанию истории стандарта компакт-диска. Динамический диапазон 16 и 24 бит, около 98 и 146 дБ по формуле 1,76 + 6,02b при практическом пределе преобразователей около 123 дБ, — по описанию разрядности цифрового звука. Параметры режима высокой точности звука (48 кГц, 96 кбит/с в моно и 192 в стерео, временное отключение шумоподавления) — по справке Zoom.