
ГАЙД
В каком формате забирать расшифровку: DOCX, SRT, VTT и остальные
В меню «Скачать» семь пунктов, и от выбора зависит, придётся ли переделывать работу. Что лежит внутри каждого файла, что теряется при выгрузке и какой формат брать под свою задачу.
Формат расшифровки выбираете не вы, а тот, кто откроет файл следующим
Ошибка с форматом расшифровки стоит не денег, а вечера: скачали DOCX «потому что это же текст» — и сорок минут режете его на субтитры руками; взяли SRT под статью — получили простыню из номеров и таймингов вперемешку с речью. Половина недоразумений с субтитрами объясняется одним символом — запятой вместо точки.
Что лежит в расшифровке до того, как вы нажали «Скачать»
В исходнике три слоя данных, и они независимы друг от друга. Что теряется при выгрузке — это всегда вопрос о том, какой из трёх остался за бортом.
- Текст. Сами слова, разбитые на реплики — куски речи между паузами и сменами говорящего. Реплика может быть в два слова, а может тянуться полминуты.
- Время. У каждой реплики есть начало и конец с точностью до миллисекунд, а внутри реплики время известно и для отдельных слов. Именно поэтому клик по фразе в редакторе попадает не «примерно туда», а в нужную секунду записи.
- Говорящий. Метка, кто произнёс реплику. Разделение спикеров — отдельный слой: сам текст не меняется, меняется подпись над ним, когда вы переименовываете «Спикер 1» в Ирину.
Ни один файл не уносит все три слоя одинаково. Субтитры берут текст и время, но выбрасывают абзацы и почти всегда — имя говорящего. Word забирает текст, говорящих и время реплик, но не время отдельных слов. TXT не берёт времени вовсе. Единственный формат, который выносит наружу всё до последнего поля, — JSON.

SRT: номер, тайминг, текст, пустая строка
SubRip, он же SRT, — самый распространённый формат субтитров и самый простой из всех. Файл состоит из одинаковых блоков, разделённых пустой строкой. В блоке всего три части, и выглядит он так.
7— порядковый номер блока. Нумерация сплошная, с единицы и без пропусков: на пропуске некоторые плееры спотыкаются.00:00:04,120 --> 00:00:07,480— когда субтитр появляется и когда исчезает. Часы, минуты, секунды, затем запятая и миллисекунды. Между двумя временами — пробел, стрелка из двух дефисов и знака «больше», снова пробел.Менеджер: Тогда фиксируем пятнадцатое сентября.— сам текст: одна или две короткие строки.- Пустая строка — конец блока. Дальше идёт блок с номером 8, и так до конца записи.
Никакой шапки у файла нет, он начинается сразу с единицы. Имени говорящего в формате тоже не предусмотрено: если оно нужно, его пишут прямо в текст, как в примере выше. Так устроена и наша выгрузка в SRT — когда в расшифровке есть спикеры, подпись уходит в начало реплики, потому что деть её больше некуда.
У SRT нет опубликованного стандарта: формат разошёлся из старой программы SubRip и держится на общей договорённости. Отсюда все его странности. Теги оформления вроде <i> и <b> поддерживаются по-разному, позиционирование текста на экране не предусмотрено вовсе, а кодировку файла плееру приходится угадывать. Зато принимают его почти везде: в списке форматов, которые понимает загрузка субтитров на YouTube, SubRip стоит первым среди базовых.
VTT: то же самое, но по правилам и для веба
WebVTT (расширение .vtt) придумали для веба, и, в отличие от SRT, у него есть спецификация W3C. Отсюда строгость: файл обязан быть в UTF-8, отдаётся с типом text/vtt и начинается со слова WEBVTT в первой строке. Без этой строки он просто не считается файлом субтитров.
WEBVTT— обязательная первая строка, за ней пустая.7— идентификатор реплики. В VTT он необязателен и не обязан быть числом: туда можно писать что угодно, напримерvopros-o-srokah.00:00:04.120 --> 00:00:07.480— те же начало и конец, но доли секунды отделяются точкой. Часы можно опустить, если запись короче часа:04:12.500— допустимая запись.<v Менеджер>Тогда фиксируем пятнадцатое сентября.— текст с тегом голоса: имя говорящего в VTT задаётся отдельно от самой реплики, а не смешивается с ней.
Дальше начинается то, чего в SRT нет в принципе: комментарии в блоках NOTE, которые плеер не показывает, оформление обычным CSS в блоке STYLE и настройки положения прямо в строке тайминга — куда прижать субтитр, какой он ширины, как выровнен текст. Для ролика на площадке это избыточно, а для видео на своём сайте — иногда единственный способ увести подпись из-под логотипа в углу. Сам текст для такой дорожки берут из полной транскрибации ролика.
Но главное отличие практическое: есть место, где VTT обязателен. Встроенный в браузер плеер подключает субтитры тегом <track>, и формат для него — WebVTT. Переименованный SRT здесь не подхватится — субтитров на видео просто не будет, и ошибку вы не увидите. Поэтому для субтитров к видео на собственном сайте берут .vtt, а .srt — для загрузки на площадку.
Чем отличается SRT от VTT: разбор по строкам
На глаз файлы почти одинаковые, а различия сидят ровно в тех местах, которые проще всего не заметить.
| Что сравниваем | SRT | VTT |
|---|---|---|
| Первая строка файла | сразу блок с номером 1 | обязательное слово WEBVTT |
| Доли секунды | через запятую: 00:00:04,120 | через точку: 00:00:04.120 |
| Часы в тайминге | пишутся всегда | можно опустить |
| Номер блока | обязателен, нумерация сплошная | необязателен, может быть словом |
| Имя говорящего | нет, пишут внутрь текста | есть, отдельный тег <v Имя> |
| Оформление и позиция | теги курсива, поддержка у плееров разная | CSS в блоке STYLE, регионы, настройки строки |
| Комментарии | нет | есть, блоки NOTE |
| Стандарт | нет, сложился на практике | есть, спецификация W3C |
| Кодировка | какая сохранится, обычно UTF-8 | только UTF-8, это часть спецификации |
| Где требуется чаще | загрузка на видеоплощадки, монтаж | плеер на своём сайте, тег <track> |
Практический вывод простой. Площадка принимает оба — берите SRT, он совместимее: его же понимают редакторы монтажа, куда файл идёт для вертикальных клипов. Видео живёт на вашем сайте — берите VTT. Переименовывать файл бесполезно: смена расширения не добавит шапку WEBVTT и не заменит запятые на точки, а плеер сверяет именно их. Как загрузить готовую дорожку обратно на канал, разобрано в статье про субтитры на YouTube.
Почему реплику нельзя просто положить в субтитр
Здесь ловушка, в которую попадают все, кто первый раз делает субтитры из расшифровки. Реплика в расшифровке и субтитр — не одно и то же. Реплика — это то, что человек сказал между двумя паузами, и длиться она может двадцать секунд. Субтитр — то, что помещается на экран и успевает прочитаться, пока висит.
Отраслевые нормы дают конкретные числа. В требованиях Netflix к субтитрам на русском языке — до 42 знаков в строке и максимум две строки на блок, скорость чтения до 17 знаков в секунду для взрослой аудитории и до 13 для детской. Общие требования той же студии задают и длительность: не короче 5/6 секунды и не длиннее 7 секунд на блок. Цифры отличаются от площадки к площадке, но порядок величин везде такой.
- Не больше двух строк. Третья закрывает картинку и всё равно не успевает прочитаться.
- До 42 знаков в строке. На узком экране длинная строка либо переносится сама, либо уезжает за край.
- От 5/6 секунды до 7 секунд. Короче — глаз не успевает зацепиться, дольше — субтитр «висит» и раздражает.
- До 17 знаков в секунду. Это про соотношение: если реплика быстрая, текст придётся сокращать, а не ужимать тайминг.
Поэтому в готовом .srt блоков всегда больше, чем реплик в расшифровке. Длинную фразу режут по смыслу: на границе придаточного, перед перечислением, между двумя мыслями. Рвать посреди устойчивого оборота нельзя — глаз спотыкается, даже если формально в лимит уложились.
DOCX и PDF: файлы, которые читают люди
DOCX — формат для случая, когда текст будут читать, править и пересылать. Это обычный документ Word: открывается в любом редакторе, правки видны, комментарии на полях ставятся, лишнее удаляется. Внутри лежит не голая простыня текста.
- Заголовок с названием записи и списком участников — понятно, к чему относится файл, даже через полгода.
- Реплики, сгруппированные по говорящим: имя выделено, рядом время начала.
- Таймкоды у каждого перехода к новому спикеру — по ним спорное место находится в записи за секунду.
- Если поверх расшифровки собран отчёт, он ложится в тот же документ отдельным блоком: краткое содержание, решения, задачи с владельцами и сроками.

PDF решает другую задачу: зафиксировать вид. Документ выглядит одинаково у всех, его нельзя случайно поправить и он нормально печатается. Правило простое: DOCX для работы с текстом, PDF для рассылки и печати.
Тому, кто монтирует, эти файлы не нужны вовсе — ему нужен SRT: он импортируется на дорожку и сразу даёт подписи с готовыми таймингами. DOCX идёт рядом только тогда, когда по тексту ещё пишут сценарий, описание или пост.

TXT и Markdown: сырьё для дальнейшей обработки
TXT — это только текст, без всякого оформления. В нашей выгрузке он выглядит так: подпись говорящего в квадратных скобках отдельной строкой, под ней его реплики подряд.
[Менеджер]— строка с подписью, дальше идёт всё, что этот человек сказал подряд.Тогда фиксируем пятнадцатое сентября.— обычный текст без разметки и без времени.[Клиент]— следующая подпись появляется только там, где говорящий сменился.
Времени в TXT нет вообще — это его главная особенность и главный минус. Зато файл открывается везде, вставляется куда угодно и весит копейки. Берут его тогда, когда текст нужно вставить в письмо, положить в общий поиск, отдать на вычитку или прогнать через свои скрипты.
Markdown — тот же текст, но с минимальной структурой: название записи заголовком первого уровня, каждый говорящий — заголовком второго. В таком виде расшифровка нормально ложится в базу знаний, в вики или в заметки: заголовки сразу превращаются в структуру страницы, и по ней можно свернуть-развернуть говорящих.
Выбор между ними такой: TXT — когда текст пойдёт дальше в обработку и разметка будет только мешать; Markdown — когда файл станет страницей, которую кто-то откроет и будет листать.
JSON: формат для программ, а не для чтения
JSON нужен там, где расшифровку читает не человек. Своя система, скрипт, база, монтажный конвейер — всё, что должно разобрать текст на части и что-то с ними сделать. Внутри лежит название записи, счётчик реплик и массив сегментов, каждый со своими полями.
"start_s": 4.12и"end_s": 7.48— начало и конец реплики в секундах, дробным числом, а не строкой."text": "Тогда фиксируем пятнадцатое сентября."— сам текст реплики."speaker_id"— метка говорящего, по которой реплики одного человека собираются вместе."words"— тайминги отдельных слов внутри реплики: тот самый слой, который теряют все остальные форматы."language"и"confidence"— язык фрагмента и оценка уверенности, если они нужны вашей логике.
Для видео это даёт две вещи, которых нет больше нигде. Первая — нарезка точно по фразе: границы куска берутся не на слух, а по времени первого и последнего слова, поэтому вертикалка не начинается с обрубленного слога. Вторая — подписи, где слово подсвечивается ровно в тот момент, когда звучит. Ни того, ни другого не собрать из DOCX: там уже нет данных, только вёрстка.
Если файлы качать неудобно и расшифровки нужны потоком, ту же структуру отдаёт API для транскрибации — тогда промежуточный файл вообще не появляется, и текст приходит сразу в вашу систему.
Формат → кому отдаём → что теряется
Колонка «что теряется» здесь важнее остальных: именно из-за неё файл приходится выгружать заново.
| Формат | Кому отдаём | Что сохраняет | Что теряется |
|---|---|---|---|
| DOCX | человеку: править, согласовать, приложить к письму | спикеров, время реплик, структуру документа, отчёт | тайминги слов, машинную обработку |
| человеку: разослать, распечатать, подшить | фиксированный вид у всех и на любом устройстве | возможность править и разбирать текст программой | |
| SRT | видеоплощадке, монтажёру, плееру | текст и время каждого блока | абзацы, имя говорящего как отдельное поле, позицию на экране |
| VTT | браузерному плееру на своём сайте | время, имя говорящего тегом, стили и позицию | совместимость с частью старых редакторов |
| TXT | почте, поиску, вычитке | текст и подписи говорящих | время целиком, любое оформление |
| Markdown | базе знаний, вики, заметкам | текст и структуру по говорящим | время целиком |
| JSON | другой программе | все три слоя, включая тайминги слов | читаемость для человека |
Как выгрузить и не переделывать
Порядок, который экономит второй заход, — одинаковый для звонка, встречи и видео.
- Сначала правки, потом выгрузка. Переименуйте «Спикер 1» в имена, проверьте по записи цифры, даты и фамилии. Всё это уедет во все форматы разом, и править потом придётся в каждом файле отдельно.
- Назовите адресата. Человек, площадка, плеер или программа — из ответа сразу следует расширение. Если адресатов двое, файлов тоже будет два.
- Для субтитров проверьте длинные реплики. Там, где человек говорил без пауз, блок стоит разбить: два ряда по 42 знака — потолок, а не рекомендация.
- Для вертикального клипа берите фрагмент, а не всю запись. Часовой SRT в монтаже придётся чистить от лишних блоков; минутный кусок ложится на дорожку сразу и подписи стоят там, где нужно.
- Для документов решите, будут ли править. Будут — DOCX. Не будут, но будут пересылать и печатать — PDF.
- Для чужой системы берите JSON, а не TXT. Соблазн отдать «просто текст» велик, но потом окажется, что нужны тайминги, а их уже нет.
- Оставьте исходник в сервисе. Файлы разойдутся по папкам и почтам, а расшифровка останется на месте: любой формат выгружается заново, и запись при этом не тратится.
- Загрузкааудио или видео, до 4 ГБ и 6 часов
- Расшифровкаспикеры и таймкоды
- Правкаимена, цифры, спорные места
- Экспортформат под адресата, хоть все сразу
Забрать расшифровку в нужном виде
Загрузите запись — Vibe2Text вернёт текст с разделением говорящих и таймкодами, а дальше выгрузка в DOCX, PDF, TXT, Markdown, SRT, VTT или JSON из одного и того же исходника.
Получить расшифровкуБесплатный старт без карты, файлы до 4 ГБ и до 6 часов, русский и английский.
Частые вопросы
Чем отличается SRT от VTT?
Четырьмя вещами. Файл VTT обязан начинаться со слова WEBVTT, у SRT шапки нет. Доли секунды в SRT отделяются запятой, в VTT — точкой. Имя говорящего в SRT можно только вписать в текст, а в VTT для этого есть отдельный тег. И VTT умеет то, чего в SRT нет: комментарии, CSS-оформление, позиционирование субтитра на экране. Смысл при этом у форматов одинаковый — блоки текста с началом и концом.
В каком формате скачать расшифровку, чтобы отправить её заказчику?
DOCX, если текст будут править или комментировать, и PDF, если файл просто читают, печатают или подшивают. В обоих случаях в документе есть шапка, имена говорящих и таймкоды, а если поверх расшифровки собран отчёт — краткое содержание, решения и задачи ложатся в тот же файл.
Какой формат субтитров нужен для видео на моём сайте?
VTT. Браузерный плеер подключает субтитры тегом track, и рабочий формат для него — WebVTT; SRT в этом месте не работает, причём молча — субтитров просто не будет. Для загрузки ролика на видеоплощадку, наоборот, чаще берут SRT: его принимают почти все, включая YouTube.
Можно ли просто переименовать файл .srt в .vtt?
Нет. Плеер смотрит не на расширение, а на содержимое: в VTT нужна первая строка WEBVTT, а доли секунды должны отделяться точкой, а не запятой. Переименованный файл либо не подхватится вовсе, либо покажет субтитры не в тех местах. Проще выгрузить нужный формат заново — обе выгрузки собираются из одной расшифровки.
Почему в скачанном SRT вместо русских букв набор символов?
Это кодировка, а не ошибка распознавания. Файлы отдаются в UTF-8 — так их ждут видеоплощадки, современные редакторы и браузеры. Старые плееры и телевизоры иногда рассчитывают на windows-1251: тогда файл достаточно открыть в текстовом редакторе и пересохранить в нужной кодировке, содержимое от этого не изменится.
Зачем нужен экспорт в JSON, если я не программист?
Скорее всего, незачем. JSON нужен, когда расшифровку читает программа: своя система, скрипт, база, монтажный конвейер. Его отличие в том, что он единственный уносит тайминги отдельных слов и служебные поля вроде языка фрагмента. Для чтения глазами он неудобен, и это нормально.
Можно ли получить и текстовый документ, и субтитры из одной загрузки?
Да, запись обрабатывается один раз, а форматы собираются из готовой расшифровки по требованию — хоть все семь подряд. Обычный сценарий такой: DOCX для документа, SRT или VTT для видео, а исходник остаётся в сервисе на случай, когда через месяц понадобится ещё один формат.
Проверено 14 августа 2026. Устройство файла WebVTT — по спецификации W3C «WebVTT: The Web Video Text Tracks Format»: обязательная строка WEBVTT, кодировка UTF-8 и тип text/vtt, точка как разделитель долей секунды, необязательные часы, необязательный идентификатор реплики, блоки NOTE, STYLE (селектор ::cue) и REGION, теги <v>, <b>, <i>, <u>. Требование формата WebVTT для элемента <track> — по документации MDN Web Docs. Список форматов субтитров, которые принимает загрузка на YouTube, включая SubRip (.srt) и WebVTT (.vtt), — по справке YouTube «Поддерживаемые форматы субтитров». Нормы длины строки (до 42 знаков) и скорости чтения (до 17 знаков в секунду для взрослой аудитории, до 13 для детской) — по Netflix Russian Timed Text Style Guide; максимум две строки в субтитре и длительность блока от 5/6 секунды до 7 секунд — по Netflix Timed Text Style Guide: General Requirements.