Текст для поиска
Текст помогает быстро вычитать интервью, урок или видеообращение.
Запись камеры в текст
Загрузите видео с камеры и получите чистый текст речи для редакции, архива или субтитров.
Текст помогает быстро вычитать интервью, урок или видеообращение.
Спикеры отделяют ведущего, гостя и вопросы из зала.
Таймкоды ускоряют монтаж и поиск удачных дублей.
Экспорт DOCX, TXT, SRT/VTT подходит для публикации и архива.
Кому подходит
Встречи, задачи и решения в тексте.
Интервью, цитаты и заметки рядом с аудио.
Подкасты, видео, субтитры и черновики.
Лекции, вебинары и конспекты.
Подробно о задаче
Час интервью на камеру — это редко час полезного материала. Это два-три часа исходников с дублями, паузами на смену карты, переспросами и «давайте ещё разок, я сбился». Разобрать это по памяти невозможно, а пересматривать целиком дорого: монтажёр, который ищет удачный ответ перемоткой, тратит на поиск больше времени, чем на сам монтаж. Текстовая расшифровка меняет способ работы. Вы читаете вместо того, чтобы смотреть, а читаете вы в несколько раз быстрее. Нужный ответ находится поиском по словам, а не по памяти. У каждой фразы стоит время, поэтому от найденного текста до нужной секунды в таймлайне — один шаг. Для интервью это разница между «монтажёр отсматривает материал два дня» и «редактор размечает текст за час, монтажёр собирает по разметке».
Загружается всё, что даёт звук. Практически это три источника, и у каждого свои особенности. Файл с камеры. MP4, MOV, а у части моделей — MTS или контейнер AVCHD. Первые два грузятся как есть. Если камера пишет AVCHD, проще вытащить звуковую дорожку или перегнать файл в MP4 — это же обычно требуется и для монтажа. Запись с телефона. Самый частый источник для отзывов и коротких обращений. Грузится напрямую, качество звука обычно приличное, если телефон был ближе метра к говорящему. Внешний рекордер. Лучший вариант по звуку и одновременно самый неудобный: дорожка идёт отдельно от видео. Для расшифровки это не проблема — картинка не нужна, — а вот для монтажа дорожки придётся синхронизировать, и удобнее делать это по хлопку в начале дубля. Если есть выбор, из какого источника брать звук, берите тот, что ближе к говорящему: петличка лучше накамерного микрофона, накамерный лучше встроенного в телефон.
Интервью — это диалог, и в сплошном тексте он читается плохо. Разделение по голосам расставляет реплики по говорящим: видно, где вопрос, а где ответ, и не приходится догадываться по смыслу. Работает это по голосу, а не по каналам записи, поэтому не важно, писались ли собеседники на разные микрофоны. Двое, сидящие у одной петлички, тоже разделятся. Сначала участники получают метки «Спикер 1» и «Спикер 2». Если кто-то представился в кадре — «меня зовут Ирина, я руковожу отделом» — имя подставится автоматически. Остальных переименовывают один раз, и метка меняется по всему тексту. Вопросы из зала — отдельный случай. Они обычно записаны хуже всего: человек говорит от микрофона далеко, без петлички. Такие реплики стоит проверять: если вопрос пойдёт в публикацию, его почти всегда приходится дописывать по смыслу.
Каждая реплика в расшифровке несёт отметку времени, и это главный практический выигрыш для съёмочной группы. Рабочая схема выглядит так. Редактор читает расшифровку и отмечает удачные ответы — не «примерно на сороковой минуте», а с точностью до фразы. Получившийся список с таймкодами уходит монтажёру. Монтажёр не отсматривает материал, а идёт по списку. На интервью в два часа это экономит рабочий день. На проекте из десяти интервью — неделю. Второй сценарий — выбор дубля. Когда одну и ту же мысль сняли трижды, в тексте это видно как три похожих абзаца с разным временем. Сравнить формулировки глазами быстрее, чем пересматривать три дубля подряд. Клик по строке в расшифровке проигрывает именно этот фрагмент — удобно для спорных мест, где надо услышать интонацию, а не прочитать слова.
Расшифровка не спасёт плохой звук, но хороший звук делает её почти безошибочной. Несколько вещей, которые стоят десяти минут на площадке и экономят часы вычитки. Петличка на каждого говорящего. Самое сильное улучшение из возможных, сильнее любой обработки после. Комната без эха. Голые стены, кафель и пустой конференц-зал — худшее, что бывает: голос отражается и накладывается сам на себя. Ковёр, шторы и мягкая мебель решают проблему бесплатно. Тишина в паузах. Кондиционер, проектор, холодильник за стеной дают ровный гул, который съедает тихие согласные. Выключите то, что можно выключить. Не перебивать. Просьба к ведущему не поддакивать в ответ — на монтаже это тоже мешает, а в расшифровке превращает чужую реплику в обрывки. И одно техническое: если пишете на несколько устройств, хлопните в ладоши в начале — по этому пику дорожки потом синхронизируются за секунду.
Связная речь распознаётся ровно. Спотыкается автоматика на именах собственных, и это предсказуемо. Фамилии, особенно редкие и нерусские. Названия компаний и продуктов. Профессиональные термины узкой области — медицинские, юридические, инженерные. Аббревиатуры, которые в речи произносятся слитно. Лечится это не построчной вычиткой, а поиском: нашли первое вхождение, посмотрели, как записано, заменили по всему документу. Минута работы вместо получаса. На потоке — базой знаний. Один раз внесённые названия проектов, фамилии постоянных спикеров и отраслевые термины подставляются в следующие расшифровки правильно. Для студии, которая снимает один и тот же продукт месяцами, это снимает почти всю вычитку. Отдельно проверяйте то, что пойдёт в титры и в публикацию: имя героя, его должность, название компании. Остальное можно оставить как есть.
Из расшифровки собираются субтитры в SRT и VTT — форматах, которые понимает любой плеер и любая платформа. Автоматическая разбивка учитывает длину строки и скорость чтения. Это не мелочь: реплику, произнесённую за полторы секунды, нельзя показать целиком — её надо разбить на две подписи, иначе зритель не успевает. А слишком длинная строка обрезается на экране телефона. Поэтому нарезать готовый текст по точкам нельзя: получится набор вспышек. Разбивка идёт по смысловым паузам с оглядкой на тайминг. Для публикации ролика это ещё и вопрос охвата: видео с подписями смотрят без звука, а это большая часть мобильной аудитории. Файл субтитров подгружается отдельно и не требует перезаливки самого видео.
Съёмка отзывов почти всегда заканчивается одинаково: сняли десять человек, смонтировали два ролика, восемь остались лежать на диске. Между тем в них — готовый текст для кейсов, сайта и коммерческих предложений, произнесённый живыми клиентами их словами. Расшифровка превращает эти восемь записей в материал. Из них вытаскиваются цитаты — точные, с указанием, кто сказал, и с временем, по которому фразу можно проверить или вырезать на клип. Копирайтеру не надо ничего придумывать: у него есть, как клиенты сами описывают проблему и результат. Это же снимает вечный спор о согласовании: клиент видит свою настоящую цитату, а не пересказ маркетолога, и согласует её быстрее. Практический совет: расшифровывайте отзыв сразу после съёмки, а не когда понадобится. Через полгода вы не вспомните, у кого из десяти было то самое удачное сравнение.
Записанная лекция без текстовой версии живёт плохо: её смотрят один раз, а возвращаются к ней почти никогда — перематывать два часа ради одного объяснения никто не станет. Расшифровка с автоматическими главами превращает лекцию в документ с оглавлением. Слушатель видит структуру — вступление, теория, разбор примера, ответы на вопросы — и открывает нужный кусок. То же оглавление, выгруженное в описание ролика, даёт тайм-коды. Поверх текста собирается конспект: короткое саммари, тезисы списком, задание, если оно было. Это то, что раздают участникам, и то, ради чего половина из них вообще приходит. Отдельная ценность — блок вопросов и ответов в конце. Расшифрованный, он превращается в FAQ для следующего потока, а заодно показывает, что осталось непонятым.
Ограничение — до 4 ГБ на файл. Часовое интервью в 1080p обычно укладывается; съёмка в 4K с высоким битрейтом — нет. Решение простое и быстрое: расшифровке нужен только звук, поэтому вытащите звуковую дорожку без перекодирования — `ffmpeg -i INPUT.MOV -vn -acodec copy audio.m4a`. Из десятигигабайтного исходника получится файл на несколько десятков мегабайт, загрузится он за секунды, а текст будет тот же самый. Тот же приём выручает на слабом канале связи: заливать звук вместо видео быстрее в десятки раз. Если писали на внешний рекордер, у вас уже есть отдельная дорожка — грузите её, она и по качеству лучше накамерной. Разрешение видео на результат не влияет никак: работает только звук.
Порядок, который не разваливается на потоке, выглядит так. Сразу после съёмки скиньте материал и вытащите звук — одной командой, пока карта в кардридере. Это пять минут, которые потом экономят полдня. Загрузите дорожку и получите расшифровку. Пока идёт обработка, никто никого не ждёт: она быстрее реального времени. Переименуйте спикеров — один раз на проект. Дальше все реплики подписаны правильно. Прогоните расшифровку поиском по фамилиям и названиям, поправьте их скопом. Разметьте удачные ответы и выгрузите список с таймкодами — это техзадание монтажёру. Экспортируйте, что кому нужно: DOCX редактору, SRT к ролику, TXT в архив. Весь цикл на часовое интервью занимает меньше времени, чем один просмотр исходника.
Возьмите не показательную съёмку, а трудную: интервью с фоновым шумом, лекцию из зала с эхом, разговор, где собеседники перебивают друг друга. Если результат на ней приемлемый, на хорошем материале он будет отличным. Смотреть надо на три вещи: правильно ли разделены говорящие, насколько верно записаны имена и термины, читается ли текст без переслушивания. Попробовать можно бесплатно и без карты. Это единственный честный способ выбрать: качество расшифровки зависит от вашего звука и вашей терминологии, а не от обещаний на странице.
На съёмке всегда остаётся материал, который никуда не пошёл, и он не бесполезен — просто до него не доходят руки. Не вошедшие ответы. Из часового интервью в ролик попадает восемь минут; остальное — не брак, а просто не поместилось. В тексте это готовые материалы для статьи, для карточек в соцсетях, для блока «полная версия интервью» на сайте. Оговорки и повторы, которые в тексте видны сразу. Если герой три раза начинал ответ по-разному, в расшифровке видно, какая формулировка получилась точнее. Монтажёр это тоже слышит, но за три просмотра, а не за один взгляд. Технический брак. Место, где сел микрофон или прошёл посторонний звук, в расшифровке выглядит как провал или бессмыслица — и находится сразу, а не на финальном просмотре, когда переснять уже нельзя.
Когда снимают на две-три камеры, дорожек тоже получается несколько, и возникает вопрос, какую отдавать на расшифровку. Правило простое: берите ту, где голос ближе и чище, а не ту, что синхронна с основной картинкой. Расшифровке безразлично, какая камера была главной, — ей нужен разборчивый звук. Петличка ведущего почти всегда лучше любого накамерного микрофона. Если говорящих писали на отдельные петлички и дорожки не сведены, есть два пути. Свести их в один файл перед загрузкой — тогда разделение по голосам расставит реплики как обычно. Или расшифровать дорожки по отдельности и сопоставить по времени — дольше, но даёт идеально чистое разделение, где ни одна реплика не приписана не тому. Для интервью на двоих первый путь почти всегда достаточен.
Расшифровка снимает самый долгий этап работы с интервью — согласование. Классическая схема выглядит так: смонтировали ролик, показали герою, герой попросил убрать фразу, монтаж переделывается. Дорого и обидно. Схема с текстом: расшифровку отправляют герою до монтажа. Он читает за десять минут вместо просмотра часа исходников, вычёркивает, что просит убрать, уточняет должность и название компании. Монтаж делается уже по согласованному тексту и переделок не требует. Побочный выигрыш: герой почти всегда правит собственные формулировки в лучшую сторону — устная речь в тексте выглядит рыхлее, чем звучала, и он сам это видит. Отдавать стоит вычищенную версию, а не сырую: сплошная стенограмма с «э-э» и повторами читается как неуважение, даже если содержит всё нужное.
Через год после съёмки помнить, что именно говорил герой, невозможно, а исходники к тому времени лежат на дальнем диске под именем `INTERVIEW_FINAL_2.MOV`. Расшифрованный архив решает это одним свойством: по нему можно искать словами. «Кто из наших клиентов говорил про сроки внедрения» находится за секунду по всем съёмкам, а не перебором папок. Для продакшена и маркетинга это превращает съёмочный архив из склада в источник. Материал, снятый два года назад, начинает работать снова, потому что его наконец можно найти. Практика, которая себя оправдывает: расшифровывать сразу после съёмки, а не когда понадобится. Расшифровка стоит одинаково в любой момент, а вот вспомнить контекст — кто эти люди, что за проект, почему этот дубль лучше — можно только по горячим следам.
Полная вычитка часового интервью съедает выигрыш во времени. Проверять стоит три вещи. Имена, должности и названия компаний — то, что пойдёт в титры и в публикацию. Ошибка здесь заметнее всего. Числа: суммы, сроки, проценты, даты. Слышатся верно, записываются по-разному. Отрицания. Редкий, но самый дорогой класс ошибок: «мы не планируем» вместо «мы планируем» переворачивает смысл. В цитатах для публикации отрицания стоит переслушать — клик по строке проигрывает нужный фрагмент. Остальное — пунктуацию, слова-паразиты, оговорки — чистят одним проходом, если текст идёт в публикацию, и оставляют как есть, если он идёт в архив.
Из одной расшифровки собираются разные документы, и переделывать ничего не нужно — формат выбирается под адресата. DOCX — рабочий формат редактора и корректора: правки, комментарии, сборка статьи из интервью. TXT — архив и поиск. Ничего не весит, открывается везде, хорошо ложится в любое хранилище. SRT и VTT — субтитры к ролику, подгружаются отдельно без перезаливки видео. PDF — согласование с героем и отправка наружу, когда документ не должны править по дороге. Список цитат с таймкодами — не формат, а выжимка, но именно он чаще всего нужен монтажёру: несколько фраз и время, где они звучат. И саммари — короткий пересказ на несколько абзацев для тех, кто в проекте не участвовал, но должен понимать, что сняли.
Съёмочные исходники живут на дисках ровно до первой чистки. Часовое интервью в 4K — это десятки гигабайт, десять интервью — уже терабайт, и рано или поздно кто-то решает, что место дороже. Расшифровка весит в тысячи раз меньше. Час разговора — сотня килобайт текста против гигабайтов видео. Это разница между «храним, пока не станет дорого» и «храним всегда». Отсюда правило для продакшена: смонтированный ролик — не единственный результат съёмки. Текст исходников остаётся, когда сами исходники стёрты, и именно по нему через год находят фразу, которую тогда не взяли в монтаж, а сейчас она понадобилась. Видео при этом никуда не девается как формат — оно нужно, чтобы услышать интонацию и увидеть человека. Просто оно перестаёт быть единственной копией того, что было сказано.
Пять пунктов, которые занимают десять минут на площадке и снимают большую часть будущей вычитки. Петличка на каждого говорящего. Если петличек нет — микрофон ближе метра ко рту, а не на камере. Комната с мягкими поверхностями. Ковёр, шторы, диван. Голые стены и кафель дают эхо, которое портит распознавание сильнее шума. Выключенная техника: кондиционер, проектор, вентилятор в ноутбуке. Договорённость не перебивать. Ведущему — не поддакивать вслух: в тексте это превращает чужую реплику в обрывки, а на монтаже мешает точно так же. Хлопок в начале дубля, если пишете на несколько устройств: по этому пику дорожки синхронизируются за секунду вместо получаса подгонки на глаз.
Выберите тип записи, формат или рабочий процесс.
Частые вопросы
Загрузите видео с камеры, телефона или внешнего рекордера, укажите язык и число спикеров — сервис извлечёт звук, распознает речь и разложит реплики по говорящим с таймкодами. Готовый текст вычитывается в редакторе с прослушиванием и выгружается в DOCX для редакции, TXT для архива или SRT для монтажа.
Для этого включается диаризация: реплики раскладываются по спикерам, и в тексте видно, где говорит ведущий, где гость, а где вопрос из зала. Перед запуском укажите несколько спикеров — без этого реплики диалога склеятся, и вычитывать интервью станет заметно труднее.
Бесплатный старт обходится без карты, а первый транскрипт съёмки доступен сразу после загрузки файла. Этого достаточно, чтобы разобрать одно интервью или видеоотзыв, вытащить цитаты для кейса и понять, подходит ли формат для регулярной вычитки съёмок и подготовки субтитров.
Каждая реплика привязана к таймкоду, поэтому по тексту легко сравнить варианты одной фразы и перейти к нужной секунде видео. Отмечайте неудачные дубли и паузы прямо при вычитке — так монтажёр ориентируется в записи по тексту и не тратит время на перемотку в поисках лучшего варианта.
Фамилии, должности и названия компаний — самое частое место для правки в любой расшифровке, поэтому их стоит проверить вручную в редакторе, сверяясь со звуком. Для публикации, кейса или рассылки это критично: ошибка в имени спикера или названии бренда заметнее обычной опечатки.
Да, после распознавания текст выгружается в SRT и VTT для монтажа и публикации. Перед выпуском сверьте спорные фразы с оригиналом, особенно если говорящий частил или глотал окончания, — так субтитры точно совпадут с речью по времени и не собьют зрителя в динамичных сценах.
Vibe2Text
Загрузите аудио или видео, пока на запуске сервис открыт бесплатно.