
РАЗБОР
Сервисы расшифровки в России: по каким признакам они делятся
Вкладок с обзорами двенадцать, а решение не складывается: в одном списке перемешаны сервисы с несовместимой механикой. Разбираем рынок по пяти типам — какую задачу закрывает каждый, чем ограничен и как за полчаса проверить кандидата на своей записи.
Сервисы расшифровки аудио в России: пять типов вместо списка из двадцати названий
Сервисы расшифровки аудио в России выбирают примерно одинаково. К вечеру в браузере открыто одиннадцать вкладок. Подборка «топ-15 сервисов транскрибации», две карточки из рекламы, форум, где спорят о точности, таблица, собранная кем-то в позапрошлом году, и три лендинга, обещающих одно и то же разными словами. Час прошёл, выбор не сдвинулся ни на шаг.
Причина не в нехватке информации. В одном списке оказались вещи, устроенные принципиально по-разному: голосовой ввод, который печатает за вами в браузере; кабинет, куда перетаскивают файл; бот, приходящий на созвон; речевой API для программиста; кнопка расшифровки внутри самой видеоконференции. Это пять механик, а не пятнадцать конкурентов, и упираются они в разные стены.
Мест и победителей ниже не будет: «лучший» здесь определяется тем, что именно вы собираетесь расшифровывать, а не свойствами сервиса. Бренды приведены как примеры типа, а не как рекомендация; всё, что о них сказано, взято с их официальных страниц — ссылки и дата проверки в конце статьи.
Тип 1. Диктовщики: текст вместо клавиатуры
Первый тип отвечает на задачу, в которой записи ещё нет. Вам надо не расшифровать прошлое, а произвести текст: письмо, черновик статьи, заметку по итогам разговора, который только что закончился. Голос тут — просто способ ввода, быстрее клавиатуры и удобнее в дороге.
Механика простейшая: микрофон включён, слова появляются на экране по ходу речи. В Google Документах это «Инструменты» → «Голосовой ввод»; функция работает в последних версиях Chrome, Edge и Safari, русский в списке языков есть, а голосовые команды — только на английском. Похожие инструменты встроены в мобильные клавиатуры и в настольные системы, и стоят они ноль.
Границы у типа жёсткие, зато очевидные с первой минуты. Готовый файл сюда не положишь: диктовщику нужен живой микрофон, а не запись. Разделения говорящих нет — он и не рассчитан на то, что говорят двое. Таймкодов нет, потому что нет дорожки, к которой их привязывать. Знаки препинания часто приходится наговаривать голосом, а сплошной поток текста потом вычитывать. И главное: за экраном надо следить, потому что переслушать будет нечего. Подробный разбор способа — в статье про голосовой ввод текста.
Кому подходит. Тем, кто пишет от себя: юристу, диктующему проект письма, врачу, наговаривающему заключение между приёмами, менеджеру, который вышел из переговорной и надиктовывает три абзаца, пока не забыл. Как только в кадре появляется второй человек и запись, тип перестаёт работать — и дальше начинается всё остальное.
Тип 2. Сервисы-загрузчики: запись приносите вы
Второй тип начинается там, где файл уже существует. Диктофонная запись планёрки, mp3 из виртуальной АТС, скачанная запись вебинара, видео с телефона, голосовое из мессенджера — происхождение неважно, важно, что запись есть и лежит у вас. Это единственный тип, которому всё равно, где именно она велась.
Механика: вы отдаёте файл, сервис возвращает текст, размеченный по говорящим, с временем у каждой реплики, и второй слой поверх него — краткое содержание, принятые решения, задачи с владельцами и сроками. Дальше документ выгружается в формат, в котором вы работаете, а сама запись остаётся в архиве и ищется вместе с остальными.

Vibe2Text относится ровно к этому типу, и это стоит сказать прямо: запись мы за вас не добываем — её приносите вы. Приносить можно по-разному: файлом, ссылкой на видео, записью прямо в браузере или впустив бота на онлайн-встречу. Дальше маршрут одинаковый: расшифровка раскладывает реплики по говорящим, подставляет имена из самого разговора, если участники представились, ставит время у каждой реплики, а поверх собирает саммари, решения и задачи. По архиву работает поиск, а чат по записи отвечает цитатами с отметками времени. Рамки простые: файлы до 4 ГБ и до 6 часов, русский и английский, экспорт в DOCX, PDF, TXT, Markdown, JSON, SRT и VTT, старт бесплатный и без карты.
Слабое место у типа общее, и его честнее назвать сразу: два ручных шага. Запись надо сначала получить — скачать из ВКС, снять с диктофона, выгрузить из CRM, — а потом загрузить. Если созвонов десять в неделю, эти два шага кто-то повторяет каждый раз. Второе ограничение — ожидание: длинный файл обрабатывается не мгновенно. Третье — лимиты по весу и длине, которые у всех разные и обнаруживаются ровно в тот момент, когда текст нужен срочно.
Кому подходит. Тем, у кого записи разного происхождения и разной давности: диктофон, звонки, вебинары, интервью, архив за три года. Всё это ложится в один кабинет, ищется одним поиском и выгружается одинаково — независимо от того, на что записывалось.

Тип 3. ИИ-ассистенты встреч: бот приходит на созвон
Третий тип избавляет ровно от того ручного шага, который остаётся у второго. Бот подключается к онлайн-встрече как ещё один участник, слушает её целиком и к концу отдаёт текст и краткое содержание. Скачивать и загружать не приходится ничего: календарь и ссылка на встречу заменяют обе операции.
Так устроены известные зарубежные ассистенты, и по их тарифным страницам хорошо видно, из чего складывается тип. У Otter на бесплатном плане — 300 минут расшифровки в месяц, не длиннее 30 минут на разговор, и три импорта готовых файлов за всё время жизни аккаунта; расшифровка там заявлена для английского, испанского, французского, немецкого, японского и китайского. Fireflies на бесплатном плане обещает безлимитную расшифровку при 400 минутах хранения на команду, безлимитные ИИ-саммари и 20 ИИ-кредитов, а бот подключается к Zoom, Google Meet и Teams. Для русскоязычной работы в этих строчках важнее всего первая: какие языки и какие площадки перечислены. Что проверить, если вы уже сидите на одном из них: переход с Otter.ai и перенос встреч из Fireflies.

Ограничения вытекают из той же механики. Бота надо впустить, и участники его видят — там, где это не принято, встреча начинается с объяснений. Работает он только там, где есть онлайн-созвон: переговоры в кабинете, звонок по телефону, лекция в аудитории проходят мимо. Архив оседает в кабинете ассистента отдельно от всего, что вы расшифровывали другим способом. И согласие участников никуда не девается: предупреждать о записи нужно так же, как при любой другой.
Кому подходит. Командам с плотным календарём онлайн-встреч на одной-двух площадках, где рутина «скачай — загрузи» повторяется ежедневно и стоит дороже, чем ещё один участник в списке.
Тип 4. Речевые API: текст уходит не человеку, а программе
Четвёртый тип узнаётся по первому экрану сайта: там код, а не кнопка загрузки. Речевой API — продукт для разработчика: запись уходит запросом, текст возвращается ответом, а что с ним делать дальше, решает ваша система. Человек в этой схеме не открывает никакого кабинета, потому что кабинета обычно и нет.
У российских платформ это отдельные продукты со своей документацией. SaluteSpeech в документации Сбера описан как сервис синтеза и распознавания речи; чтобы начать, нужен рабочий проект в Studio и токен доступа, а для юридических лиц предусмотрены отдельные условия использования. Логика у речевых API схожая: аккаунт, проект, ключ, оплата по объёму обработанного аудио, а конкретные лимиты и цены ищут в документации, а не на лендинге.
Главное ограничение звучит не как недостаток, а как условие входа: у API нет интерфейса. Ни кабинета, ни редактора, ни архива, ни поиска, ни выгрузки в DOCX — всё это пишется на вашей стороне. Задача «получить текст» решается за день, задача «сделать так, чтобы этим пользовался отдел» превращается в проект со сроками и поддержкой. Если разработчика нет, тип не ваш, каким бы привлекательным ни выглядел ценник за минуту.
Кому подходит. Командам с потоком в тысячи записей, собственной системой, куда должен приезжать текст, и человеком, который напишет интеграцию и будет её поддерживать. Типичный случай — колл-центр, складывающий расшифровки в свою аналитику, или продукт, внутри которого расшифровка это одна из функций. Более широкий разбор сценариев — в гайде по выбору сервиса транскрибации.
Тип 5. Расшифровка внутри самой видеоконференции
Пятый тип — не отдельный сервис, а функция площадки, на которой вы и так встречаетесь. Подключать нечего: запись и её текст живут в том же кабинете, что и сама встреча, а доступ определяется тарифом и правами администратора. Это самый короткий путь из всех, пока встречи не выходят за пределы одной платформы.
У МТС Линк в блоке ИИ-возможностей встреч заявлена текстовая расшифровка, а виртуальный ассистент, по описанию на странице сервиса, «проанализирует ваши встречи и расскажет, что обсуждали, какие решения приняли и задачи поставили»; на бесплатном тарифе размер файлового хранилища — 500 Мб. Контур.Толк обещает полную текстовую расшифровку встречи с тайм-кодами и ИИ-протокол, «где зафиксирует принятые решения и список задач с ответственными и дедлайнами», а также хронологический пересказ; в облачном варианте записи и переписки хранятся на серверах в России, есть вариант на своих серверах, а начать можно с бесплатного тарифа «Старт». Яндекс Телемост описан как бесплатные видеовстречи без регистрации и ограничения по времени, а встречу можно записать, «чтобы пересматривать и делиться с теми, кто не мог на них присутствовать».
Ограничение одно, зато определяющее: тип работает только для встреч своей площадки. Компания, у которой часть созвонов идёт в одной ВКС, часть в другой, а переговоры с подрядчиком записываются на телефон, получает три архива в трёх местах и ни одного поиска, который прошёл бы по всем сразу. Добавьте привязку функций к тарифу и к правам администратора: включить расшифровку иногда может не тот, кому она нужна. Что из этого следует на практике — в сравнении Телемоста и МТС Линка и в разборе расшифровки встреч в Контур.Толке.
Кому подходит. Командам, у которых действительно все встречи проходят в одной платформе, а записей со стороны не бывает. Как только появляется вторая площадка или диктофон, к этому типу почти всегда добавляется второй.
Сводка: тип, задача, граница
Пять строк, по которым видно, что типы не конкурируют друг с другом напрямую: у каждого своя работа и своя стена. Строку с «точностью» в этой таблице искать бесполезно — она зависит от вашей записи, а не от типа.
| Тип | Что закрывает | Где упирается | Кому подходит |
|---|---|---|---|
| Диктовщик | Текст, которого ещё нет: письмо, заметка, черновик | работает только с живым микрофоном, без говорящих и таймкодов | тем, кто пишет от себя |
| Расшифровка внутри ВКС | Встречи той площадки, где вы и так работаете | только своя платформа, тариф и права администратора | командам с одной ВКС |
| ИИ-ассистент с ботом | Поток онлайн-созвонов без ручной выгрузки | нужны онлайн-встреча и согласие впустить бота | командам с плотным календарём |
| Сервис-загрузчик | Любые записи в одном архиве с поиском и экспортом | запись надо принести самому и дождаться обработки | тем, у кого записи разного происхождения |
| Речевой API | Текст внутри своей системы, тысячи файлов потоком | интерфейса нет: кабинет и архив пишете сами | командам с разработчиком |
Куда в итоге попадает архив
Разница между типами становится осязаемой не в день расшифровки, а через полгода, когда кто-то спрашивает: «в каком созвоне мы это решили?» Ответ зависит не от качества текста, а от того, где текст лежит и что лежит рядом с ним.
Ни один тип не обязан быть единственным, и связки выше — не компромисс, а обычная практика. Каждая механика делает то, что умеет, а вопрос «где искать через полгода» получает один ответ вместо трёх. Что при этом влияет на сам текст — тема, никак не связанная с типом: она разобрана на странице про качество распознавания.
Как проверить кандидата на своей записи за полчаса
Тип определяется одним вопросом, пригодность — одной своей записью. Демонстрационный файл с сайта для этого не годится: берите типичную рабочую запись, лучше не самую удачную. Полчаса по шагам ниже отвечают на вопрос «мой ли это тип и где его стена», а не на вопрос «кто точнее».
- Определите тип за минуту. Найдите на сайте ответ на один вопрос: откуда сервис берёт запись — с микрофона, из встречи, файлом или из вашего кода. Если формулировки размытые, посмотрите на скриншоты: там всегда видно, есть ли окно загрузки и поле для ссылки на встречу.
- Проверьте, принимает ли он вашу запись вообще. Длина, вес, формат. Часовая планёрка на полтора гигабайта — обычное дело, и ровно на ней отсеивается часть кандидатов ещё до разговора о качестве.
- Посмотрите, есть ли говорящие и таймкоды. Без них текст встречи остаётся простынёй: не собрать ни протокола, ни задач, а спорную фразу нечем проверить.
- Выгрузите документ в свой формат и откройте его. Текст на экране и текст в скачанном файле — разные вещи; смотрите, доехали ли имена говорящих и отметки времени.
- Найдите цену для своего объёма и способ оплаты. Карта российского банка, счёт и закрывающие документы для юрлица — на зарубежных сервисах этот шаг часто и заканчивает выбор. Ориентиры по цене — на странице стоимости расшифровки.
- Удалите тестовую запись. Убедитесь, что она пропала из архива и из поиска. Заодно узнаете, есть ли кнопка удаления и где она живёт.
- Сравнивайте внутри типа. Загрузчик с загрузчиком, ассистента с ассистентом. Сравнение диктовщика с речевым API не даёт никакой информации, кроме того, что они разные.
- Вопросоткуда берётся запись
- Своя записьтипичная, а не демо
- Документэкспорт в рабочий формат
- Выходоплата, счёт, удаление
Если тип подошёл и внутри него осталось двое-трое кандидатов, дальше идёт другая процедура — семь критериев на одном тестовом файле. А где проходит граница бесплатного и почему длинная запись всё равно попросит аккаунт, разобрано в статье про бесплатную расшифровку.

Проверьте на своей записи, а не на чужой таблице
Загрузите типичную рабочую запись: Vibe2Text вернёт текст с разделением говорящих и таймкодами, а поверх — краткое содержание, решения и задачи с владельцами и сроками.
Расшифровать записьБесплатный старт без карты, файлы до 4 ГБ и до 6 часов. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.
Частые вопросы
Какие бывают сервисы расшифровки аудио в России?
Практичнее делить их не по названиям, а по механике — типов пять. Диктовщики печатают за вами в реальном времени. Сервисы-загрузчики принимают готовый файл и возвращают документ с говорящими и таймкодами. ИИ-ассистенты приходят на онлайн-встречу ботом. Речевые API отдают текст вашей программе. Пятый тип — расшифровка, встроенная в саму видеоконференцию. Один и тот же список «топ-15» обычно перемешивает все пять, поэтому и не помогает выбрать.
Чем российские сервисы транскрибации отличаются от зарубежных на практике?
Различия начинаются не с текста, а с бытовых вещей: принимает ли сервис карту российского банка, выдаёт ли счёт и закрывающие документы юрлицу, на каком языке справка и поддержка, где хранятся данные. Отдельно стоит смотреть на список поддерживаемых языков: например, на бесплатном плане Otter расшифровка заявлена для английского, испанского, французского, немецкого, японского и китайского. Проверять это надо на официальной странице тарифов, а не в обзорах.
Есть ли отечественный аналог Otter?
Аналог правильнее искать по типу, а не по бренду. Otter — ИИ-ассистент встреч: бот приходит на онлайн-созвон и отдаёт текст с саммари. В России эту роль закрывают два соседних типа: встроенная расшифровка внутри ВКС, если все встречи идут на одной площадке, и сервисы-загрузчики, которые умеют принимать ссылку на встречу и подключаться к ней. Выбор между ними зависит от того, бывают ли у вас записи со стороны — с диктофона, из телефонного звонка, из другой платформы.
Какой сервис расшифровки выбрать, если встречи идут в разных ВКС?
В этом случае встроенная расшифровка каждой площадки решает задачу наполовину: тексты появляются, но живут в трёх разных кабинетах, и общего поиска по ним нет. Практичная схема — оставить встроенную расшифровку там, где она удобна, а полный архив держать в сервисе-загрузчике, куда попадают записи из любой платформы, с диктофона и из телефонии.
Можно ли обойтись расшифровкой, встроенной в видеоконференцию?
Да, если все встречи действительно проходят на одной площадке, доступ к функции есть у тех, кому она нужна, а записей со стороны не бывает. Проверьте заранее две вещи: на каком тарифе включается расшифровка и сколько времени хранятся записи и тексты — от этого зависит, останется ли у вас архив через год.
Нужен ли API, если записей очень много?
Количество записей само по себе не повод. API нужен тогда, когда текст должен попасть в вашу систему — CRM, аналитику, продукт, — и есть разработчик, который напишет интеграцию и будет её поддерживать. Если текст читают люди, а не программы, тот же объём дешевле закрыть загрузчиком с архивом, поиском и выгрузкой в готовые форматы.
Как за минуту понять, к какому типу относится сервис?
Задайте один вопрос: откуда он берёт запись. Микрофон здесь и сейчас — диктовщик. Ссылка на встречу — ассистент с ботом. Окно загрузки файла — загрузчик. Пример кода и слово «ключ» на первом экране — речевой API. Кнопка внутри вашей видеоконференции — встроенная расшифровка. Дальше остаётся проверить границы того типа, который вам подходит.
Проверено 14 августа 2026 по официальным страницам сервисов: справка Google о голосовом вводе в Документах (пункт «Инструменты» → «Голосовой ввод», поддержка последних версий Chrome, Edge и Safari, наличие русского в списке языков, голосовые команды только на английском); страница тарифов Otter (бесплатный план: 300 минут расшифровки в месяц, до 30 минут на разговор, три импорта файлов за всё время, перечень языков расшифровки); страница тарифов Fireflies (бесплатный план: безлимитная расшифровка, 400 минут хранения на команду, безлимитные ИИ-саммари и 20 ИИ-кредитов, подключение бота к Zoom, Google Meet и Teams); страница «МТС Линк Встречи» (текстовая расшифровка в блоке ИИ-возможностей, описание виртуального ассистента, файловое хранилище 500 Мб на бесплатном тарифе); страница «Контур.Толк» (полная текстовая расшифровка встречи с тайм-кодами, ИИ-протокол с решениями и задачами, хронологический пересказ, хранение на серверах в России и вариант на своих серверах, бесплатный тариф «Старт»); страница «Яндекс Телемост» в Яндекс 360 (бесплатные видеовстречи без регистрации и ограничения по времени, запись встречи); документация SaluteSpeech (сервис синтеза и распознавания речи, рабочий проект в Studio и токен доступа, отдельные условия для юридических лиц).