В каком формате забирать расшифровку: DOCX, SRT, VTT и остальные

ГАЙД

В каком формате забирать расшифровку: DOCX, SRT, VTT и остальные

В меню «Скачать» семь пунктов, и от выбора зависит, придётся ли переделывать работу. Что лежит внутри каждого файла, что теряется при выгрузке и какой формат брать под свою задачу.

Формат расшифровки выбираете не вы, а тот, кто откроет файл следующим

Ошибка с форматом расшифровки стоит не денег, а вечера: скачали DOCX «потому что это же текст» — и сорок минут режете его на субтитры руками; взяли SRT под статью — получили простыню из номеров и таймингов вперемешку с речью. Половина недоразумений с субтитрами объясняется одним символом — запятой вместо точки.

Экспорт — это выбор потерь. Если жертвовать нечем, берут два файла: один для чтения, второй для работы; выгрузка ничего не расходует.

Что лежит в расшифровке до того, как вы нажали «Скачать»

В исходнике три слоя данных, и они независимы друг от друга. Что теряется при выгрузке — это всегда вопрос о том, какой из трёх остался за бортом.

  • Текст. Сами слова, разбитые на реплики — куски речи между паузами и сменами говорящего. Реплика может быть в два слова, а может тянуться полминуты.
  • Время. У каждой реплики есть начало и конец с точностью до миллисекунд, а внутри реплики время известно и для отдельных слов. Именно поэтому клик по фразе в редакторе попадает не «примерно туда», а в нужную секунду записи.
  • Говорящий. Метка, кто произнёс реплику. Разделение спикеров — отдельный слой: сам текст не меняется, меняется подпись над ним, когда вы переименовываете «Спикер 1» в Ирину.

Ни один файл не уносит все три слоя одинаково. Субтитры берут текст и время, но выбрасывают абзацы и почти всегда — имя говорящего. Word забирает текст, говорящих и время реплик, но не время отдельных слов. TXT не берёт времени вовсе. Единственный формат, который выносит наружу всё до последнего поля, — JSON.

Расшифровка до выгрузки: слова, говорящий и время у каждой реплики ещё на месте
Пока текст живёт здесь, все три слоя целы — слова, говорящие и время. Потери начинаются на выгрузке, и у каждого формата они свои.

SRT: номер, тайминг, текст, пустая строка

SubRip, он же SRT, — самый распространённый формат субтитров и самый простой из всех. Файл состоит из одинаковых блоков, разделённых пустой строкой. В блоке всего три части, и выглядит он так.

  • 7 — порядковый номер блока. Нумерация сплошная, с единицы и без пропусков: на пропуске некоторые плееры спотыкаются.
  • 00:00:04,120 --> 00:00:07,480 — когда субтитр появляется и когда исчезает. Часы, минуты, секунды, затем запятая и миллисекунды. Между двумя временами — пробел, стрелка из двух дефисов и знака «больше», снова пробел.
  • Менеджер: Тогда фиксируем пятнадцатое сентября. — сам текст: одна или две короткие строки.
  • Пустая строка — конец блока. Дальше идёт блок с номером 8, и так до конца записи.

Никакой шапки у файла нет, он начинается сразу с единицы. Имени говорящего в формате тоже не предусмотрено: если оно нужно, его пишут прямо в текст, как в примере выше. Так устроена и наша выгрузка в SRT — когда в расшифровке есть спикеры, подпись уходит в начало реплики, потому что деть её больше некуда.

Никакой шапки у файла нет — он начинается сразу с единицы. Имени говорящего в формате не предусмотрено, поэтому подпись уходит внутрь текста.

У SRT нет опубликованного стандарта: формат разошёлся из старой программы SubRip и держится на общей договорённости. Отсюда все его странности. Теги оформления вроде <i> и <b> поддерживаются по-разному, позиционирование текста на экране не предусмотрено вовсе, а кодировку файла плееру приходится угадывать. Зато принимают его почти везде: в списке форматов, которые понимает загрузка субтитров на YouTube, SubRip стоит первым среди базовых.

VTT: то же самое, но по правилам и для веба

WebVTT (расширение .vtt) придумали для веба, и, в отличие от SRT, у него есть спецификация W3C. Отсюда строгость: файл обязан быть в UTF-8, отдаётся с типом text/vtt и начинается со слова WEBVTT в первой строке. Без этой строки он просто не считается файлом субтитров.

  • WEBVTT — обязательная первая строка, за ней пустая.
  • 7 — идентификатор реплики. В VTT он необязателен и не обязан быть числом: туда можно писать что угодно, например vopros-o-srokah.
  • 00:00:04.120 --> 00:00:07.480 — те же начало и конец, но доли секунды отделяются точкой. Часы можно опустить, если запись короче часа: 04:12.500 — допустимая запись.
  • <v Менеджер>Тогда фиксируем пятнадцатое сентября. — текст с тегом голоса: имя говорящего в VTT задаётся отдельно от самой реплики, а не смешивается с ней.

Дальше начинается то, чего в SRT нет в принципе: комментарии в блоках NOTE, которые плеер не показывает, оформление обычным CSS в блоке STYLE и настройки положения прямо в строке тайминга — куда прижать субтитр, какой он ширины, как выровнен текст. Для ролика на площадке это избыточно, а для видео на своём сайте — иногда единственный способ увести подпись из-под логотипа в углу. Сам текст для такой дорожки берут из полной транскрибации ролика.

Но главное отличие практическое: есть место, где VTT обязателен. Встроенный в браузер плеер подключает субтитры тегом <track>, и формат для него — WebVTT. Переименованный SRT здесь не подхватится — субтитров на видео просто не будет, и ошибку вы не увидите. Поэтому для субтитров к видео на собственном сайте берут .vtt, а .srt — для загрузки на площадку.

Смена расширения не добавляет строку WEBVTT и не заменяет запятые на точки. Ошибку при этом не показывают — подписи просто не появляются.

Чем отличается SRT от VTT: разбор по строкам

На глаз файлы почти одинаковые, а различия сидят ровно в тех местах, которые проще всего не заметить.

На глаз файлы почти одинаковые. Плеер сверяет именно эти три места, поэтому переименование расширения ничего не решает.
Что сравниваемSRTVTT
Первая строка файласразу блок с номером 1обязательное слово WEBVTT
Доли секундычерез запятую: 00:00:04,120через точку: 00:00:04.120
Часы в таймингепишутся всегдаможно опустить
Номер блокаобязателен, нумерация сплошнаянеобязателен, может быть словом
Имя говорящегонет, пишут внутрь текстаесть, отдельный тег <v Имя>
Оформление и позициятеги курсива, поддержка у плееров разнаяCSS в блоке STYLE, регионы, настройки строки
Комментариинетесть, блоки NOTE
Стандартнет, сложился на практикеесть, спецификация W3C
Кодировкакакая сохранится, обычно UTF-8только UTF-8, это часть спецификации
Где требуется чащезагрузка на видеоплощадки, монтажплеер на своём сайте, тег <track>

Практический вывод простой. Площадка принимает оба — берите SRT, он совместимее: его же понимают редакторы монтажа, куда файл идёт для вертикальных клипов. Видео живёт на вашем сайте — берите VTT. Переименовывать файл бесполезно: смена расширения не добавит шапку WEBVTT и не заменит запятые на точки, а плеер сверяет именно их. Как загрузить готовую дорожку обратно на канал, разобрано в статье про субтитры на YouTube.

Почему реплику нельзя просто положить в субтитр

Здесь ловушка, в которую попадают все, кто первый раз делает субтитры из расшифровки. Реплика в расшифровке и субтитр — не одно и то же. Реплика — это то, что человек сказал между двумя паузами, и длиться она может двадцать секунд. Субтитр — то, что помещается на экран и успевает прочитаться, пока висит.

Отраслевые нормы дают конкретные числа. В требованиях Netflix к субтитрам на русском языке — до 42 знаков в строке и максимум две строки на блок, скорость чтения до 17 знаков в секунду для взрослой аудитории и до 13 для детской. Общие требования той же студии задают и длительность: не короче 5/6 секунды и не длиннее 7 секунд на блок. Цифры отличаются от площадки к площадке, но порядок величин везде такой.

В готовом файле блоков всегда больше, чем реплик: фразу режут по смыслу — на границе придаточного, перед перечислением, между двумя мыслями.
  • Не больше двух строк. Третья закрывает картинку и всё равно не успевает прочитаться.
  • До 42 знаков в строке. На узком экране длинная строка либо переносится сама, либо уезжает за край.
  • От 5/6 секунды до 7 секунд. Короче — глаз не успевает зацепиться, дольше — субтитр «висит» и раздражает.
  • До 17 знаков в секунду. Это про соотношение: если реплика быстрая, текст придётся сокращать, а не ужимать тайминг.

Поэтому в готовом .srt блоков всегда больше, чем реплик в расшифровке. Длинную фразу режут по смыслу: на границе придаточного, перед перечислением, между двумя мыслями. Рвать посреди устойчивого оборота нельзя — глаз спотыкается, даже если формально в лимит уложились.

DOCX и PDF: файлы, которые читают люди

DOCX — формат для случая, когда текст будут читать, править и пересылать. Это обычный документ Word: открывается в любом редакторе, правки видны, комментарии на полях ставятся, лишнее удаляется. Внутри лежит не голая простыня текста.

  • Заголовок с названием записи и списком участников — понятно, к чему относится файл, даже через полгода.
  • Реплики, сгруппированные по говорящим: имя выделено, рядом время начала.
  • Таймкоды у каждого перехода к новому спикеру — по ним спорное место находится в записи за секунду.
  • Если поверх расшифровки собран отчёт, он ложится в тот же документ отдельным блоком: краткое содержание, решения, задачи с владельцами и сроками.
Отчёт из пяти разделов, который уезжает в DOCX отдельным блоком: TL;DR, ключевые моменты, решения, задачи, ближайшие шаги
Если поверх расшифровки собран отчёт, в документ уходит и он. Переверстывать файл после скачивания не нужно.

PDF решает другую задачу: зафиксировать вид. Документ выглядит одинаково у всех, его нельзя случайно поправить и он нормально печатается. Правило простое: DOCX для работы с текстом, PDF для рассылки и печати.

Тому, кто монтирует, эти файлы не нужны вовсе — ему нужен SRT: он импортируется на дорожку и сразу даёт подписи с готовыми таймингами. DOCX идёт рядом только тогда, когда по тексту ещё пишут сценарий, описание или пост.

Окно экспорта: выбор формата и параметры Word — временные метки, имена спикеров, главы, оглавление
В DOCX уезжает не просто текст: метки времени, имена говорящих и оглавление включаются до скачивания. Переверстывать документ после этого не нужно.

TXT и Markdown: сырьё для дальнейшей обработки

TXT — это только текст, без всякого оформления. В нашей выгрузке он выглядит так: подпись говорящего в квадратных скобках отдельной строкой, под ней его реплики подряд.

  • [Менеджер] — строка с подписью, дальше идёт всё, что этот человек сказал подряд.
  • Тогда фиксируем пятнадцатое сентября. — обычный текст без разметки и без времени.
  • [Клиент] — следующая подпись появляется только там, где говорящий сменился.

Времени в TXT нет вообще — это его главная особенность и главный минус. Зато файл открывается везде, вставляется куда угодно и весит копейки. Берут его тогда, когда текст нужно вставить в письмо, положить в общий поиск, отдать на вычитку или прогнать через свои скрипты.

Markdown — тот же текст, но с минимальной структурой: название записи заголовком первого уровня, каждый говорящий — заголовком второго. В таком виде расшифровка нормально ложится в базу знаний, в вики или в заметки: заголовки сразу превращаются в структуру страницы, и по ней можно свернуть-развернуть говорящих.

Выбор между ними такой: TXT — когда текст пойдёт дальше в обработку и разметка будет только мешать; Markdown — когда файл станет страницей, которую кто-то откроет и будет листать.

Слой времени теряется незаметно: файл открывается, текст на месте, а привязка к записи исчезла. Отдавать «просто текст» чужой системе — та же ошибка.

JSON: формат для программ, а не для чтения

JSON нужен там, где расшифровку читает не человек. Своя система, скрипт, база, монтажный конвейер — всё, что должно разобрать текст на части и что-то с ними сделать. Внутри лежит название записи, счётчик реплик и массив сегментов, каждый со своими полями.

  • "start_s": 4.12 и "end_s": 7.48 — начало и конец реплики в секундах, дробным числом, а не строкой.
  • "text": "Тогда фиксируем пятнадцатое сентября." — сам текст реплики.
  • "speaker_id" — метка говорящего, по которой реплики одного человека собираются вместе.
  • "words" — тайминги отдельных слов внутри реплики: тот самый слой, который теряют все остальные форматы.
  • "language" и "confidence" — язык фрагмента и оценка уверенности, если они нужны вашей логике.

Для видео это даёт две вещи, которых нет больше нигде. Первая — нарезка точно по фразе: границы куска берутся не на слух, а по времени первого и последнего слова, поэтому вертикалка не начинается с обрубленного слога. Вторая — подписи, где слово подсвечивается ровно в тот момент, когда звучит. Ни того, ни другого не собрать из DOCX: там уже нет данных, только вёрстка.

Если файлы качать неудобно и расшифровки нужны потоком, ту же структуру отдаёт API для транскрибации — тогда промежуточный файл вообще не появляется, и текст приходит сразу в вашу систему.

Формат → кому отдаём → что теряется

Колонка «что теряется» здесь важнее остальных: именно из-за неё файл приходится выгружать заново.

ФорматКому отдаёмЧто сохраняетЧто теряется
DOCXчеловеку: править, согласовать, приложить к письмуспикеров, время реплик, структуру документа, отчёттайминги слов, машинную обработку
PDFчеловеку: разослать, распечатать, подшитьфиксированный вид у всех и на любом устройствевозможность править и разбирать текст программой
SRTвидеоплощадке, монтажёру, плеерутекст и время каждого блокаабзацы, имя говорящего как отдельное поле, позицию на экране
VTTбраузерному плееру на своём сайтевремя, имя говорящего тегом, стили и позициюсовместимость с частью старых редакторов
TXTпочте, поиску, вычиткетекст и подписи говорящихвремя целиком, любое оформление
Markdownбазе знаний, вики, заметкамтекст и структуру по говорящимвремя целиком
JSONдругой программевсе три слоя, включая тайминги словчитаемость для человека

Как выгрузить и не переделывать

Порядок, который экономит второй заход, — одинаковый для звонка, встречи и видео.

  1. Сначала правки, потом выгрузка. Переименуйте «Спикер 1» в имена, проверьте по записи цифры, даты и фамилии. Всё это уедет во все форматы разом, и править потом придётся в каждом файле отдельно.
  2. Назовите адресата. Человек, площадка, плеер или программа — из ответа сразу следует расширение. Если адресатов двое, файлов тоже будет два.
  3. Для субтитров проверьте длинные реплики. Там, где человек говорил без пауз, блок стоит разбить: два ряда по 42 знака — потолок, а не рекомендация.
  4. Для вертикального клипа берите фрагмент, а не всю запись. Часовой SRT в монтаже придётся чистить от лишних блоков; минутный кусок ложится на дорожку сразу и подписи стоят там, где нужно.
  5. Для документов решите, будут ли править. Будут — DOCX. Не будут, но будут пересылать и печатать — PDF.
  6. Для чужой системы берите JSON, а не TXT. Соблазн отдать «просто текст» велик, но потом окажется, что нужны тайминги, а их уже нет.
  7. Оставьте исходник в сервисе. Файлы разойдутся по папкам и почтам, а расшифровка останется на месте: любой формат выгружается заново, и запись при этом не тратится.
  1. Загрузкааудио или видео, до 4 ГБ и 6 часов
  2. Расшифровкаспикеры и таймкоды
  3. Правкаимена, цифры, спорные места
  4. Экспортформат под адресата, хоть все сразу

Забрать расшифровку в нужном виде

Загрузите запись — Vibe2Text вернёт текст с разделением говорящих и таймкодами, а дальше выгрузка в DOCX, PDF, TXT, Markdown, SRT, VTT или JSON из одного и того же исходника.

Получить расшифровку

Бесплатный старт без карты, файлы до 4 ГБ и до 6 часов, русский и английский.

Частые вопросы

Чем отличается SRT от VTT?

Четырьмя вещами. Файл VTT обязан начинаться со слова WEBVTT, у SRT шапки нет. Доли секунды в SRT отделяются запятой, в VTT — точкой. Имя говорящего в SRT можно только вписать в текст, а в VTT для этого есть отдельный тег. И VTT умеет то, чего в SRT нет: комментарии, CSS-оформление, позиционирование субтитра на экране. Смысл при этом у форматов одинаковый — блоки текста с началом и концом.

В каком формате скачать расшифровку, чтобы отправить её заказчику?

DOCX, если текст будут править или комментировать, и PDF, если файл просто читают, печатают или подшивают. В обоих случаях в документе есть шапка, имена говорящих и таймкоды, а если поверх расшифровки собран отчёт — краткое содержание, решения и задачи ложатся в тот же файл.

Какой формат субтитров нужен для видео на моём сайте?

VTT. Браузерный плеер подключает субтитры тегом track, и рабочий формат для него — WebVTT; SRT в этом месте не работает, причём молча — субтитров просто не будет. Для загрузки ролика на видеоплощадку, наоборот, чаще берут SRT: его принимают почти все, включая YouTube.

Можно ли просто переименовать файл .srt в .vtt?

Нет. Плеер смотрит не на расширение, а на содержимое: в VTT нужна первая строка WEBVTT, а доли секунды должны отделяться точкой, а не запятой. Переименованный файл либо не подхватится вовсе, либо покажет субтитры не в тех местах. Проще выгрузить нужный формат заново — обе выгрузки собираются из одной расшифровки.

Почему в скачанном SRT вместо русских букв набор символов?

Это кодировка, а не ошибка распознавания. Файлы отдаются в UTF-8 — так их ждут видеоплощадки, современные редакторы и браузеры. Старые плееры и телевизоры иногда рассчитывают на windows-1251: тогда файл достаточно открыть в текстовом редакторе и пересохранить в нужной кодировке, содержимое от этого не изменится.

Зачем нужен экспорт в JSON, если я не программист?

Скорее всего, незачем. JSON нужен, когда расшифровку читает программа: своя система, скрипт, база, монтажный конвейер. Его отличие в том, что он единственный уносит тайминги отдельных слов и служебные поля вроде языка фрагмента. Для чтения глазами он неудобен, и это нормально.

Можно ли получить и текстовый документ, и субтитры из одной загрузки?

Да, запись обрабатывается один раз, а форматы собираются из готовой расшифровки по требованию — хоть все семь подряд. Обычный сценарий такой: DOCX для документа, SRT или VTT для видео, а исходник остаётся в сервисе на случай, когда через месяц понадобится ещё один формат.

Проверено 14 августа 2026. Устройство файла WebVTT — по спецификации W3C «WebVTT: The Web Video Text Tracks Format»: обязательная строка WEBVTT, кодировка UTF-8 и тип text/vtt, точка как разделитель долей секунды, необязательные часы, необязательный идентификатор реплики, блоки NOTE, STYLE (селектор ::cue) и REGION, теги <v>, <b>, <i>, <u>. Требование формата WebVTT для элемента <track> — по документации MDN Web Docs. Список форматов субтитров, которые принимает загрузка на YouTube, включая SubRip (.srt) и WebVTT (.vtt), — по справке YouTube «Поддерживаемые форматы субтитров». Нормы длины строки (до 42 знаков) и скорости чтения (до 17 знаков в секунду для взрослой аудитории, до 13 для детской) — по Netflix Russian Timed Text Style Guide; максимум две строки в субтитре и длительность блока от 5/6 секунды до 7 секунд — по Netflix Timed Text Style Guide: General Requirements.