
ГАЙД
Видеоподкаст: как из одной записи получить видео, аудио и текст
Снимали один раз, а выпускать надо трижды: ролик на площадку, аудиоверсию в каталоги и текст. Что заложить в съёмку, чтобы это было возможно, и какой конвейер собрать после неё.
Видеоподкаст — это одна съёмка и три разных продукта
Видеоподкаст снимают один раз, а выпускают трижды: ролик уходит на видеоплощадку, аудиоверсия — в подкаст-каталоги, текст расходится на шоуноты, статью и посты. Съёмка при этом одна, и все проблемы закладываются именно в неё: то, что прекрасно смотрится в кадре, в аудио превращается в паузу, а в тексте — в дыру.
Дальше по порядку: что теряется при переходе от ветки к ветке, что из-за этого надо заложить в съёмку и как выглядит конвейер после неё. Маршрут обычного аудиоподкаста — от подготовки до публикации эпизода — разобран отдельно: выпуск подкаста от записи до публикации; здесь речь именно про то, что добавляет камера.
Что отваливается на переходе видео → аудио → текст
Полезно один раз честно посмотреть, чем эти три носителя отличаются по объёму информации. Видео несёт всё: слова, интонацию, мимику, жест, слайд на экране, реакцию собеседника. Аудио оставляет слова и интонацию. Текст оставляет только слова — и то без пауз и ударений.
Отсюда правило, которое проще всего держать в голове на площадке: смысл не должен жить в картинке. Картинка может его усиливать, показывать, украшать — но если единственный носитель мысли это то, что видно в кадре, две ветки из трёх её потеряют. Ниже пять типовых мест, где это происходит, и то, во что они превращаются дальше по цепочке.
| Момент записи | Как это выглядит в аудиоверсии | Как это выглядит в тексте |
|---|---|---|
| Гость кивает и разводит руками | Пауза непонятной длины | Ничего: провал между репликами |
| На экране график, ведущий молча ведёт по нему пальцем | Тишина, слушатель считает, что пропала связь | Пустое место между абзацами |
| Двое заговорили одновременно, но в кадре видно, кто уступил | Каша: слышны оба, непонятно, кто победил | Слипшиеся реплики без владельца |
| Имя гостя показано плашкой в углу кадра | Не звучит вовсе | Отсутствует, а спикер подписан нейтрально |
| Ведущий пишет термин маркером на доске | Слышно скрип маркера | Слово записано на слух и, скорее всего, неверно |
Дорожка на каждого: без неё разваливается именно аудиоверсия
Отдельный микрофон и отдельная звуковая дорожка на каждого участника — единственное решение из этого списка, которое стоит денег. Оно же единственное, которое нельзя добрать потом. И важна тут не столько чистота звука, сколько вот что: в видео перебивание спасает картинка, а в аудио — нет. Зритель видит, кто уступил очередь; слушатель слышит только кашу.
- Наложение голосов. В общей дорожке двое, заговорившие разом, слиты навсегда: убрать одного, не тронув второго, нечем. В раздельных — вы просто приглушаете лишнего.
- Разная громкость. Гость говорит тихо, ведущий громко — в общей записи это правится только для всей дорожки целиком, вместе с чужим голосом.
- Комнатные звуки у одного из участников. Кондиционер, клавиатура, шумный сосед — на своей дорожке это чинится точечно и не задевает остальных.
- Удалённый гость. Записывайте его локально у него, а не только то, что доехало по связи: провалы и артефакты канала в аудиоверсии слышны гораздо отчётливее, чем в ролике с картинкой.
- Разметка говорящих в тексте. Когда дорожки раздельные, вопрос «кто это сказал» вообще не возникает — разделение спикеров опирается на дорожку, а не на тембр.
- Резервная запись. Пишите второй сигнал хоть на телефон рядом. Из трёх продуктов рассыпаются все три, если единственный файл окажется битым.

Паузы: их закладывают заранее, а не ищут на монтаже
Монтаж ролика режется по картинке, аудиоверсия — по звуку, и склейки у них не совпадают. Место, где в ролике стоит перебивка с крупным планом, в аудио оказывается стыком двух фраз без всякого зазора. Полсекунды тишины на записи стоят ноль рублей и снимают эту проблему целиком.
- Пауза после вопроса. Ведущий задал вопрос — секунда тишины до ответа. Это и точка склейки, и место, куда потом встанет перебивка, и просто вежливость к гостю.
- Пауза перед сменой темы. Два-три вдоха перед «а теперь про другое». По такой паузе позже режутся и главы, и отдельные клипы.
- Чистый дубль вместо правки на ходу. Оговорились — пауза, затем фраза целиком заново. Склейка по паузе незаметна, склейка посреди фразы слышна всегда.
- Тридцать секунд тишины в начале смены. Комнатный фон записывается отдельно: он нужен, чтобы стыки в аудиоверсии не щёлкали, и снимается один раз.
- Хлопок в начале, если камер и рекордеров несколько. Резкий пик виден на всех дорожках сразу и синхронизирует их за секунду.
- Не заполняйте паузы междометиями. «Угу» и «ага» ведущего поверх ответа гостя в аудиоверсии убираются только вместе с куском ответа.
Имена и термины проговаривают вслух: в аудио нет титров
Плашка с именем гостя в углу кадра решает вопрос представления для зрителя и не решает его ни для кого больше. В аудиоверсии её нет. В расшифровке её тоже нет — распознавание работает со звуком, а не с картинкой, и подставить имя из титра оно не может.
- Полное представление в первую минуту. «Со мной сегодня Ирина Дементьева, руководитель службы поддержки» — вслух, а не только плашкой. Слушатель узнаёт, кто это, а в тексте вместо «Спикер 2» появляется имя.
- Имена по ходу разговора. Обращение по имени раз в несколько реплик помогает и слушателю, который потерял нить, и разметке говорящих.
- Названия и фамилии — по буквам, если они редкие. Одна секунда на площадке против десяти минут вычитки после.
- Аббревиатуры — с расшифровкой при первом употреблении. В кадре её можно было бы дать подписью, в аудио — нельзя.
- Цифры повторно словами. «Двенадцать процентов, один-два» — банально, но именно на числах текст ошибается чаще всего, а цена ошибки максимальная.
- Ссылки не диктуют, а называют. «Ссылка будет в описании» вместо чтения адреса вслух: адрес в аудио не запомнят, а в тексте он всё равно будет записан неверно.

«Вот это» с показом рукой — дыра в двух форматах из трёх
Самая частая и самая незаметная на съёмке потеря. В кадре всё понятно: ведущий показывает на график, гость кивает, разговор идёт дальше. В аудиоверсии на этом месте пауза и слово «вот», в тексте — обрывок фразы, из которого ничего не следует.
Приём здесь один и тот же во всех случаях: то, что вы показываете, вы же и называете словами. Не пересказываете картинку целиком — этого никто не просит, — а произносите вывод, ради которого её показали. Гостю это не мешает, зрителю не мешает тем более, а слушатель и читатель получают связный кусок вместо провала.
| Что происходит в кадре | Что сказать вслух | Чем это помогает |
|---|---|---|
| Показывают график или таблицу | Назвать, что на нём и какой вывод | Аудиоверсия остаётся связной, в тексте появляется тезис |
| Демонстрируют интерфейс на экране | Проговорить шаги: «открываю раздел, нажимаю экспорт» | Из этого куска потом собирается пошаговая инструкция |
| Гость показывает предмет в руках | Описать его одной фразой | Клип с этим фрагментом становится самостоятельным |
| Ведущий кивает вместо ответа | Произнести согласие словом | Разметка говорящих не теряет реплику |
| Ссылка или схема появляется плашкой | Сказать, что она будет в описании | Слушатель понимает, где искать, текст не обрывается |
Конвейер после съёмки: текст идёт вторым, а не последним
Привычный порядок — смонтировать ролик, потом вытащить аудио, потом, если останутся силы, сделать текст. На видеоподкасте он работает плохо: три сборки делаются с нуля, а текст, который мог бы сэкономить время на каждой, появляется, когда экономить уже нечего.
Разделение работ выглядит так. Один раз, на всю запись: расшифровка со спикерами и таймкодами, вычитка имён и терминов, разметка на смысловые части, отбор сильных мест. Отдельно под каждый формат: сборка ролика, сведение аудиоверсии, тексты описаний. Первая часть — общий ствол, вторая — три коротких ветки.
- Выгрузите звук отдельно. Двухчасовой видеофайл в высоком качестве легко весит больше четырёх гигабайт — предел загрузки; звуковая дорожка того же выпуска весит десятки мегабайт, а для текста нужна именно она.
- Получите расшифровку целиком, до всякого монтажа. Реплики по говорящим, время у каждой — это и есть общая основа для трёх веток.
- Вычитайте имена, названия и цифры. Не весь текст, а десяток мест; правка уходит сразу во все выгрузки.
- Разметьте выпуск по смысловым частям. Границы тем становятся и главами ролика, и таймкодами в шоунотах, и подзаголовками статьи.
- Отметьте кандидатов в клипы. Пять-семь мест, где мысль укладывается в минуту и не требует контекста.
- И только теперь расходитесь по форматам. Монтаж ролика, сведение аудиоверсии, сборка текстов — три параллельные задачи с общим исходником.

По времени картина обычно такая. Общая часть — выгрузка звука, расшифровка, вычитка и разметка — занимает примерно час на часовой выпуск, и делается она один раз. Три ветки после неё идут параллельно и по-разному: монтаж ролика остаётся самой долгой задачей, сведение аудиоверсии добавляет к ней немного, а тексты и нарезка клипов, у которых уже есть готовая основа, укладываются в вечер на двоих. Смысл перестановки в том, что этот час экономит время на каждой из трёх веток, а не только на текстовой.
Вертикальные клипы: резать по репликам, а не на глаз
Клипы — единственная ветка, которая не является уменьшенной копией выпуска: это самостоятельные ролики, у которых свои требования. Справка YouTube задаёт рамку прямо: Shorts могут быть до трёх минут, соотношение сторон — квадратное или вертикальное, и видео, загруженные после 15 октября 2024 года с такими параметрами, площадка классифицирует как Shorts автоматически.
Отсюда практическая задача: найти в двухчасовом разговоре куски, которые работают без контекста и укладываются в минуту. По таймлайну это перематывание, по тексту — чтение.
- Ищите завершённые мысли, а не яркие фразы. Клип должен отвечать на вопрос, которого зритель не слышал. Реплика «и вот тут мы поняли, что всё делали не так» без предыдущих десяти минут не работает.
- Границу ставьте по паузе, а не по слову. Начало на полувдохе читается как обрыв даже там, где смысл на месте.
- Проверяйте начало на слух. Первые две секунды решают, досмотрят ли: если там «эээ» или конец чужой реплики, клип не спасёт никакой монтаж.
- Субтитры обязательны. Вертикаль смотрят без звука чаще, чем со звуком, и текст здесь не украшение, а способ вообще быть понятым.
- Не режьте на границе двух говорящих. Смена спикера в первой секунде клипа сбивает: зритель не понимает, кто перед ним.
- Соберите очередь на неделю вперёд. Из часового выпуска обычно выходит пять-семь клипов; выкладывать их одним днём смысла нет.

Готовые строки для вертикали берут из выгрузки в SRT или VTT: тайминг уже выверен по звуку, остаётся подрезать под границы клипа. Подробнее про этот формат работы — на странице субтитры для подкаста и вертикальных нарезок.
Шоуноты, статья и посты — из той же расшифровки
Третья ветка самая дешёвая, потому что к этому моменту почти всё уже сделано: текст есть, имена вычитаны, границы тем размечены. Остаётся сборка под каждый носитель, и она занимает не вечер, а минуты.
Детали каждого из трёх жанров разбираются отдельно, повторять их здесь незачем: как устроены шоуноты и таймкоды из расшифровки подкаста и как собирается текст видео для описания канала. Разница только в том, что оба этих текста делаются из одного исходника и одновременно.

Аудиоверсия в каталогах — отдельная работа, а не дорожка из ролика
Последнее заблуждение, которое стоит времени ближе к публикации: «выложим видео, а подкаст-каталоги подтянут звук сами». Не подтянут. Каталог читает RSS-фид, и в фиде у каждого эпизода лежит собственный файл.
- Форматы разные. Для аудио через RSS Apple Podcasts принимает MP3 или AAC и рекомендует AAC; для видеоэпизодов поддерживаются MOV, MP4 и M4V.
- Видеоверсия живёт в отдельном фиде. Справка Apple прямо говорит: видеоэпизоды публикуют в новый или выделенный фид, а если аудиоверсия шоу уже есть — под видеоверсию заводят отдельное шоу, чтобы их было легко различать.
- У каждого эпизода своя техническая обвязка. Уникальный тег enclosure с адресом, размером и типом файла плюс постоянный идентификатор эпизода, который не меняется никогда.
- Значит, аудиоверсию надо свести отдельно. Из ролика её не вырезать одним движением: в видео остаются паузы под перебивки и молчаливые демонстрации, которые в аудио звучат как обрыв.
- И описания у веток разные. Описание ролика на площадке и описание эпизода в фиде решают разные задачи, хотя пишутся из одного текста.
- Съёмкадорожки, паузы, имена вслух
- Текстрасшифровка, вычитка, разметка
- Три сборкиролик, аудиоверсия, тексты
- Публикацияплощадка, фид, клипы по очереди
Съёмка готова — начните с текста, а не с монтажа
Выгрузите звуковую дорожку выпуска: Vibe2Text вернёт расшифровку с разделением участников и временем у каждой реплики, а поверх неё — краткое содержание и ключевые моменты. Экспорт в DOCX, PDF, TXT, Markdown, SRT и VTT: из одного текста собираются шоуноты, статья и субтитры для клипов.
Расшифровать выпускСтарт без карты. Файл до 4 ГБ и до 6 часов, русский и английский.
Частые вопросы
Чем видео подкаст отличается от обычного с точки зрения производства?
Количеством выходов при том же количестве съёмок. Аудиоподкаст даёт эпизод и текст, видеоподкаст — ещё и ролик с вертикальными клипами. Плата за это вносится на площадке: нужны раздельные звуковые дорожки, паузы под склейки, имена и термины вслух и запрет на визуальные отсылки без словесного пояснения. Ничего из этого потом не добирается.
Как сделать видеоподкаст, если гость подключается удалённо?
Главное — записывать звук гостя локально у него, а не только тот сигнал, который доехал по связи. Провалы и артефакты канала в ролике маскируются картинкой, а в аудиоверсии слышны отчётливо. Дальше всё как обычно: своя дорожка на каждого, хлопок или другой резкий звук в начале для синхронизации и пауза после каждого вопроса, чтобы задержка связи не съедала начало ответа.
Можно ли просто вытащить звук из ролика и выложить как аудиоподкаст?
Технически да, на практике так почти никогда не получается. В видеоверсии остаются молчаливые демонстрации, паузы под перебивки и реплики вроде «вот здесь видно» — в аудио это звучит как обрыв связи. Аудиоверсию сводят отдельно: убирают визуальные куски, подтягивают стыки, иногда дописывают короткую подводку голосом.
Почему расшифровку делают до монтажа, а не после?
Потому что из неё растут все три ветки. По тексту ищут места для склеек и клипов, из разметки тем получаются главы ролика и таймкоды шоунот, из тех же кусков собираются статья и посты. Если текст появляется последним, каждая сборка делается перематыванием таймлайна — то есть три раза подряд.
Какой длины делать вертикальные клипы?
Верхнюю границу задаёт площадка: YouTube относит к Shorts квадратные и вертикальные видео длительностью до трёх минут — для роликов, загруженных после 15 октября 2024 года, это происходит автоматически. Практическая длина обычно меньше: клип должен содержать законченную мысль, понятную без контекста выпуска, и такие куски редко бывают длиннее минуты.
Нужны ли субтитры к ролику и клипам?
К клипам — обязательно: вертикаль часто смотрят без звука, и без текста фрагмент просто не читается. К основному ролику субтитры полезны иначе: они делают речь доступной тем, кто смотрит без звука или плохо слышит, и заодно дают площадке текст, которого в самом видео нет. Строки берут из выгрузки в SRT или VTT — тайминг там уже выверен по звуку.
Что делать, если в выпуске много демонстраций экрана?
Решить до съёмки, одинаковый ли выпуск идёт в видео и в аудио. Если версии одинаковые, каждую демонстрацию проговаривают словами: «открываю раздел, нажимаю экспорт». Если версии расходятся, видеоверсию делают длиннее, а для аудио эти куски вырезают и заменяют короткой подводкой — но тогда и монтажей будет два, и заложить это время надо заранее.
Проверено 15 августа 2026 года. Требования к вертикальным роликам — справка YouTube о трёхминутных Shorts: длительность до трёх минут, квадратное или вертикальное соотношение сторон, автоматическая классификация для роликов, загруженных после 15 октября 2024 года. Форматы файлов и устройство фида для аудио- и видеоэпизодов — справка Apple Podcasts для авторов: требования к RSS-фиду (уникальный тег enclosure с адресом, размером и типом файла, постоянный идентификатор эпизода; для аудио принимаются MP3 и AAC, AAC рекомендуется) и видеоподкасты через RSS (поддерживаются MOV, MP4 и M4V; видеоэпизоды публикуются в новый или выделенный фид, а при наличии аудиоверсии под видео заводится отдельное шоу).