API расшифровки

API распознавания речи для вашего сервиса

REST API для расшифровки аудио и видео в текст: POST задачи, webhook-статусы, JSON со спикерами и таймкодами, экспорт DOCX, TXT, SRT, VTT.

Структурный JSON

Реплики, спикеры, таймкоды слов — удобно парсить и анализировать.

Уведомления о готовности

Сервис сам присылает событие, когда расшифровка готова.

Несколько форматов

JSON, DOCX, TXT, SRT, VTT — выбираете в запросе.

Не списываем минуты дважды

Повторный запрос с тем же файлом не запускает обработку заново.

Кому подходит

Команды

Встречи, задачи и решения в тексте.

Исследователи

Интервью, цитаты и заметки рядом с аудио.

Авторы

Подкасты, видео, субтитры и черновики.

Обучение

Лекции, вебинары и конспекты.

Подробно о задаче

Когда распознавание нужно встроить, а не открывать в браузере

Ручная загрузка файлов хороша, пока расшифровок единицы. Как только в вашем продукте появляются пользовательские записи, звонки из телефонии или поток учебных видео, кликать по кнопке становится нельзя — обработку надо запускать программно и забирать результат туда, где он реально нужен: в карточку, в поиск, в аналитику. Разработчику важно не «сервис распознавания вообще», а предсказуемый контракт: как отправить задачу, как узнать, что она готова, в каком виде придёт текст. API распознавания речи закрывает именно это — превращает разговор в структуру, которую ваш код разбирает без человека в цикле и без ежедневного экспорта вручную.

Три шага интеграции по REST

Схема простая и повторяемая. Сначала получаете API-ключ в кабинете разработчика и храните его на стороне сервера, а не в браузере. Затем шлёте POST с файлом или ссылкой на запись — в ответ приходит идентификатор задачи, обработка идёт асинхронно, ваш поток не блокируется. Готовность узнаёте двумя путями: подписка на webhook, когда сервис сам присылает событие о завершении, либо опрос статуса по идентификатору. На выходе — JSON с репликами, спикерами и таймкодами слов, который удобно парсить: разложить по сегментам для поиска, отдать в BI или собрать субтитры. Тот же результат при желании выгружается в DOCX, TXT, SRT или VTT — формат выбираете в запросе.

Грабли, на которые наступают при первой интеграции

Первое — ключ в клиентском коде. Если он уедет в браузерный бандл, его вытащат, поэтому все вызовы делайте с бэкенда. Второе — отсутствие идемпотентности: сеть моргнула, ретрай ушёл дважды, а вы посчитали два запуска. Повторная отправка того же файла обработку заново не запускает, но свой внешний ID и ключ идемпотентности храните сами. Третье — логи: пишите статусы и идентификаторы, но не сам текст расшифровки, иначе приватные данные утекут в систему логирования. И разделяйте ошибки API и сети — по 5xx имеет смысл повторить с задержкой, по ошибке валидации формата ретраи бесполезны, файл надо проверять до отправки.

Частые вопросы

Как начать работу с API распознавания речи?

Заведите аккаунт, получите ключ в кабинете разработчика и держите его на сервере. Первый вызов — POST с тестовой записью: в ответ придёт ID задачи. Подпишитесь на webhook или опросите статус по этому ID, разберите JSON с текстом и таймкодами. Убедившись, что контракт понятен, подключайте боевой поток.

Можно ли протестировать API бесплатно?

Оценить качество распознавания на своей записи можно бесплатно ещё до интеграции — первая расшифровка доступна без карты. Сам программный доступ по ключу открывается на платных тарифах, а тарификация идёт по минутам обработанного аудио, поэтому тестовые прогоны стоит делать на коротких файлах.

В каком виде приходит результат?

Основной формат — JSON: массив реплик с привязкой к спикерам и таймкодами вплоть до слов, его удобно раскладывать по сегментам для поиска или отдавать в аналитику. По той же задаче доступен экспорт в DOCX, TXT, SRT и VTT, так что субтитры или готовый документ не приходится собирать отдельным сервисом.

Как узнать, что расшифровка готова?

Есть два пути. Первый — webhook: сервис сам присылает событие о завершении, и ваш обработчик забирает результат без опроса. Второй — периодический запрос статуса по идентификатору задачи. Webhook экономичнее и быстрее, опрос проще для прототипа; на практике их часто комбинируют для надёжности.

Поддерживаются ли спикеры и таймкоды в API?

Да, разделение спикеров и таймкоды входят в JSON-ответ, а не только в веб-версию. Каждая реплика привязана к говорящему и позиции во времени, поэтому по API можно строить поиск по фразам, точный переход к моменту в записи и субтитры, не переслушивая аудио вручную.

Что делать при сбоях и повторах запросов?

На ошибки 5xx повторяйте запрос с нарастающей задержкой, на ошибки валидации формата ретраи бессмысленны — проверяйте файл до отправки. Храните внешний ID и ключ идемпотентности, чтобы повтор не создал дубль, и логируйте статусы, но не текст расшифровки, чтобы не выносить приватные данные в логи.

Vibe2Text

Одна загрузка. Готовый текст на выходе.

Загрузите аудио или видео, пока на запуске сервис открыт бесплатно.

Загрузить файл сейчас