Видео без скачивания
Загружайте через ссылку или файл — поддерживаем MP4, MOV, MKV, WebM.
Rutube → текст
Расшифровка Rutube-видео по ссылке: подходит для российские команды и контент-агентств.
Загружайте через ссылку или файл — поддерживаем MP4, MOV, MKV, WebM.
Авто-главы для быстрой навигации и предпросмотра видео по ключевым словам.
Авто-разбиение по длине строки и скорости чтения для YouTube, Vimeo и Rutube.
Сохраняйте свои шаблоны под повторяющиеся типы записей.
Кому подходит
Встречи, задачи и решения в тексте.
Интервью, цитаты и заметки рядом с аудио.
Подкасты, видео, субтитры и черновики.
Лекции, вебинары и конспекты.
Подробно о задаче
Расшифровка ролика начинается с одного из двух действий: вы вставляете ссылку на страницу Rutube или загружаете скачанный файл. Ссылка удобнее — ничего не надо держать на диске, — но она работает не с каждым роликом. Забирается открытое видео с обычной публичной страницы. Не забирается то, что закрыто настройками: ролик «по ссылке» без индексации, видео с ограничением по возрасту, запись из закрытого сообщества, эфир, который ещё идёт и не превратился в готовую запись. Если ссылка не открылась, это не тупик, а просто второй путь. Скачайте ролик штатной кнопкой на странице Rutube — она есть у большинства публичных видео — и загрузите файл. Дальше разницы нет никакой: и ссылка, и файл попадают в одну и ту же обработку, и результат будет одинаковым. Практическое правило для потока: проверяйте ссылку на одном ролике из серии. Если канал отдаёт видео по ссылке, он будет отдавать и остальные — настройки приватности обычно едины для всего канала. Если первый же ролик не пошёл, не тратьте время на попытки с остальными: качайте файлами.
Остаётся третий путь — записать звук с воспроизведения. Для расшифровки нужен только звук, картинка не участвует вообще, поэтому качество видео роли не играет. Подойдёт запись экрана со звуком системным средством: «Запись экрана» в macOS, «Win + Alt + R» в Windows, любая из привычных программ. Полученный файл — MP4 или MOV — загружается как обычно. Здесь есть одна ловушка, на которой теряют время: запись экрана иногда пишет звук с микрофона, а не из системы. Тогда на выходе получается тишина с шорохами комнаты. Проверьте первые десять секунд записи, прежде чем ставить на запись двухчасовой эфир. Второй вариант — вытащить только звуковую дорожку, если ролик всё-таки скачался, но весит слишком много. Дорожка вытаскивается без перекодирования, то есть быстро и без потери качества: `ffmpeg -i video.mp4 -vn -acodec copy audio.m4a`. Из полуторагигабайтного эфира получится файл на несколько десятков мегабайт, который загрузится за секунды даже на слабом канале.
На выходе получается не сплошное полотно текста, а разговор, разложенный по говорящим. Каждая реплика получает отметку времени и метку спикера, и по этой паре текст становится рабочим документом, а не просто длинной страницей. Разделение по спикерам делается по голосу, а не по расписанию эфира, поэтому оно переживает и перебивания, и то, что двое сидят у одного микрофона в студии. Сначала участники получают безличные метки — «Спикер 1», «Спикер 2». Если в эфире кто-то представился словами «Меня зовут Ирина, я из отдела разработки», имя подставится в метку автоматически. Остальных переименовывают вручную одним движением: правите метку в одном месте, и она меняется по всей расшифровке. Отметки времени работают как оглавление на каждую фразу. Клик по строке проигрывает именно этот фрагмент — то, ради чего в спорных случаях и открывают запись. Не надо тянуть ползунок наугад: нашли фразу глазами в тексте, послушали её ушами, убедились, что расшифровка не переврала.
Русский язык на длинных официальных выступлениях распознаётся ровно: связная речь по бумажке — самый простой материал для расшифровки, куда проще живого спора на кухне. Проблемы начинаются не с речью, а с именами собственными. Спотыкается распознавание на трёх вещах. Первое — названия ведомств и компаний, особенно длинные и малоизвестные: их слышно верно, но пишутся они на слух. Второе — фамилии, особенно нерусские и редкие. Третье — аббревиатуры, которые в речи произносятся слитно: «эрбэка», «эмчеэс», «жэкэха». Лечится это не пересмотром всего текста, а поиском. Откройте расшифровку, найдите первое вхождение проблемного слова и посмотрите, как система его записала. Дальше замена по всему документу занимает секунду. На поток то же самое решается базой знаний: один раз внесённые туда названия ведомств, должности и внутренние сокращения подставляются в следующие расшифровки уже правильно, и вычитка перестаёт быть отдельной работой.
Из той же расшифровки собираются субтитры в SRT и VTT — форматах, которые понимает и Rutube, и любой другой плеер. Разница между ними косметическая: SRT старше и универсальнее, VTT умеет стили и используется в вебе. Автоматическая разбивка учитывает две вещи, которые отличают читаемые субтитры от нечитаемых. Первая — длина строки: слишком длинная не помещается на экране мобильного и обрезается. Вторая — скорость чтения: реплику, произнесённую за полторы секунды, нельзя показать полностью, её надо разбить на две подписи, иначе зритель не успевает. Именно поэтому нельзя просто нарезать готовый текст по точкам — получится набор подписей, которые мельтешат. Разбивка идёт по смысловым паузам с оглядкой на тайминг, и в кадре подпись живёт достаточно долго, чтобы её прочитали. Если ролик уже опубликован, субтитры подгружаются к нему отдельным файлом и не требуют перезаливки видео. Для канала, у которого накопился архив, это самый дешёвый способ добрать просмотры: видео с субтитрами смотрят без звука, а это заметная доля мобильной аудитории.
Двухчасовая пресс-конференция или запись конференции целиком — это тот случай, ради которого расшифровку и заказывают. Читать её подряд никто не будет, поэтому текст размечается главами: смысловые куски выделяются автоматически, у каждого появляется заголовок и время начала. Главы делают с записью то же, что оглавление делает с книгой. Вместо «где-то в середине говорили про бюджет» вы получаете строку «Бюджет и сроки — 47:12» и попадаете туда одним кликом. Для эфира, который вы не смотрели, это единственный человеческий способ понять, о чём он был, за две минуты вместо двух часов. Поверх этого работает чат по расшифровке. Вопрос задаётся словами — «что сказали про сроки поставки» — а в ответ приходит цитата с отметкой времени. Это дешевле, чем читать двадцать страниц в поисках одного абзаца, и надёжнее, чем полагаться на память участника.
Дословный текст нужен реже, чем кажется. Чаще нужно то, что из него собирается. Саммари — короткий пересказ на несколько абзацев: о чём шла речь, к чему пришли, что осталось открытым. Это то, что уходит в рассылку или в чат команды вместо ссылки на двухчасовое видео, которое никто не откроет. Список задач — кто, что и к какому сроку. Из публичного эфира он собирается редко, а вот из внутренней записи — постоянно, и именно ради него запись обычно и ведут. Подборка цитат с таймкодами — рабочий материал редакции. Из часового выступления вытаскиваются пять фраз, каждая с временем, по которому её можно проверить и вырезать на клип. Для медиа и агентств это и есть основной выход: не текст целиком, а пять готовых цитат и время, где они звучат.
Обработка идёт быстрее реального времени: час записи расшифровывается за считанные минуты, а не за час. Точную цифру называть нечестно — она зависит от длины файла и текущей очереди, — но порядок именно такой: вы не ждёте столько же, сколько длится эфир. Ограничение по размеру — до 4 ГБ на файл. Для звука это десятки часов, для видео — обычно два-три часа в приличном качестве. Если эфир длиннее или файл тяжелее, вытащите звуковую дорожку: она весит в десятки раз меньше и содержит всё, что нужно для расшифровки. Попробовать можно бесплатно и без карты. Это не маркетинговая любезность, а единственный разумный способ выбирать сервис расшифровки: качество распознавания сильно зависит от того, что именно вы записываете. Возьмите свой самый трудный эфир — со сложной терминологией, с плохим микрофоном, с несколькими говорящими — и проверьте на нём. Демонстрационные файлы у всех звучат хорошо.
Разовая расшифровка и поток — это разные задачи. Разовую делают руками, поток настраивают один раз. Шаблон отчёта фиксирует, что вы хотите видеть на выходе: структуру саммари, нужные разделы, формат списка цитат. Один раз описанный сценарий применяется ко всем следующим записям, и вы получаете не «какой-то текст», а тот же документ, что и в прошлый раз, только с новым содержанием. Для редакции с еженедельным эфиром это разница между работой и рутиной. База знаний решает вторую половину задачи — терминологию. Названия проектов, фамилии постоянных спикеров, внутренние сокращения складываются в неё один раз и дальше подставляются в расшифровки правильно. Чем дольше вы работаете с одним каналом, тем меньше остаётся ручной вычитки. Третий элемент — экспорт. DOCX уходит редактору, TXT — в архив и в поиск, SRT и VTT — к ролику, PDF — на согласование. Выбирается в один клик, переделывать ничего не нужно.
Расшифровать чужой публичный ролик для себя — нормально. Это то же самое, что законспектировать лекцию: вы делаете текстовую заметку для личного использования, и никаких прав вы этим не нарушаете. Дальше начинаются нюансы. Опубликовать полную расшифровку чужого видео как свой материал — уже нет: текст выступления охраняется так же, как само выступление. Цитировать с указанием источника — можно, и это обычная редакционная практика: несколько фраз, ссылка на исходный ролик, отметка времени. Отдельная история — записи закрытых мероприятий и внутренних совещаний. Там вопрос не в авторском праве, а в конфиденциальности и в том, знали ли участники о записи. Это решается до эфира, а не после расшифровки. Если ролик ваш собственный — вопрос снимается целиком. Расшифровка своего канала, своих вебинаров и своих конференций ограничена только вашим временем.
Качество расшифровки определяется не сервисом, а исходником, и разброс тут огромный. Студийная запись пресс-конференции с петличками расшифровывается почти без ошибок. Тот же эфир, снятый на телефон из зала, даёт текст, который придётся вычитывать построчно. Что портит результат сильнее всего. Первое — эхо в помещении: голос, отражённый от голых стен, накладывается сам на себя, и распознавание слышит кашу. Второе — несколько говорящих одновременно: перебивания в тексте превращаются в обрывки. Третье — фоновая музыка под речью, особенно с вокалом. Четвёртое — далёкий микрофон: голос с трёх метров звучит тише зала. Что почти не мешает вопреки ожиданиям: акцент, если он не слишком сильный; быстрая речь; шум улицы за окном; невысокий битрейт. Записи с телефона, лежащего на столе, обычно расшифровываются нормально — при условии, что стол не в кафе. Если у вас есть выбор, из какого источника брать звук, берите тот, что ближе к говорящему: дорожку с петлички лучше дорожки с камеры, запись из системы лучше записи с микрофона ноутбука.
Полностью вычитывать расшифровку двухчасового эфира незачем — это съедает выигрыш во времени. Но три вещи проверять нужно всегда, потому что ошибка именно в них выходит боком. Числа. Суммы, проценты, даты, номера — распознавание слышит их верно, но записывает по-разному: «двадцать пять» может стать «25», а может остаться словами, «две тысячи двадцать шестой» превратиться в «2026» или в «2 026». Для новости или отчёта это критично. Имена и должности. Ошибка в фамилии спикера — то, за что редакцию поправят публично, и то, что видно сразу. Отрицания. Редкий, но самый дорогой класс ошибок: «не будет» вместо «будет» меняет смысл на противоположный. Слышится это в быстрой речи неотчётливо, поэтому в цитатах, которые вы собираетесь публиковать, отрицания стоит переслушать — клик по строке проигрывает именно этот фрагмент. Всё остальное — пунктуация, мелкие оговорки, слова-паразиты — можно оставить как есть или почистить одним проходом.
Для канала, который выпускает эфиры регулярно, текст перестаёт быть разовой услугой и становится частью производственного цикла. Из расшифровки собирается описание к ролику — не выдуманное, а составленное из того, что в ролике действительно сказано. Это заметно улучшает то, как видео находят: описание, набитое темами эфира, работает лучше строчки «Запись эфира от 12 марта». Из неё же собираются тайм-коды в описании — те самые главы, которые зритель ждёт у любого длинного видео. Их не надо расставлять вручную с секундомером. Из неё вытаскиваются цитаты на клипы. Короткие вертикальные ролики монтируются не «на глаз», а по тексту: выбрали фразу, посмотрели время, вырезали. И из неё же получается текстовая версия для сайта — страница, которая индексируется, тогда как сам ролик для поиска почти невидим.
Ручная расшифровка часа записи занимает у человека от четырёх до восьми часов в зависимости от сложности звука и требований к точности. Это не преувеличение, а нормальный отраслевой коэффициент: расшифровщик слушает фрагмент, останавливает, печатает, возвращается. Отсюда и цена услуги на рынке, и главная её проблема — не деньги, а срок. Эфир, расшифрованный через три дня, для новостной редакции бесполезен: повод уже отработали. Автоматическая расшифровка меняет обе величины: результат приходит быстрее, чем длится сам эфир, а стоимость не зависит от того, сколько времени человек потратил бы на слушание. Взамен вы берёте на себя вычитку — но вычитывать готовый текст быстрее, чем набирать его с нуля, в разы. Разумная схема для редакции: автоматическая расшифровка сразу после эфира, беглая вычитка чисел и имён редактором, публикация. Ручная расшифровка остаётся для того, где нужна стенограмма процессуального качества.
Первая и самая частая — расшифровывать эфир целиком, когда нужен один фрагмент. Если вы точно знаете, что вам нужны последние двадцать минут выступления, вырежьте их и загрузите только их: обработка пойдёт быстрее, а текст будет короче и удобнее. Вторая — терять исходник. Расшифровка не заменяет запись: спорную фразу иногда надо переслушать, а ролик к тому времени с канала уже сняли. Если эфир для вас важен, сохраните файл, а не только ссылку на страницу. Третья — откладывать расшифровку. Смысл сказанного всплывает в памяти по горячим следам: через неделю вы уже не помните, кто такой «Сергей Николаевич из второго отдела», и не сможете поправить метку спикера. Четвёртая — надеяться, что автоматика расставит правильные имена и термины сама. Пять минут на словарь перед потоком однотипных эфиров экономят часы вычитки потом. Пятая — публиковать расшифровку как есть. Устная речь в тексте выглядит неряшливо даже у отличного оратора: повторы, оговорки, незаконченные фразы. Материал для публикации всегда требует редакторского прохода, и это нормально.
Расшифровка не файл на вашем диске, а запись в кабинете, и это меняет способ работы с ней. Её можно открыть с другого устройства, дать ссылку коллеге, найти через полгода поиском по словам. Для команды это снимает вечную проблему «у кого последняя версия». Правки в метках спикеров и в тексте видит вся команда сразу, а не тот, кому переслали последний DOCX. Экспорт при этом никуда не девается: DOCX для редактора, PDF на согласование, TXT в архив, SRT и VTT к ролику. Скачать можно в любой момент и в любом формате — исходная расшифровка от этого не меняется. Если эфир закрытый и текст не должен уходить дальше вас, доступ к записи остаётся точечным: делиться нужно намеренно, ссылкой или приглашением, а не по умолчанию.
Возьмите один ролик — не первый попавшийся, а самый трудный: с несколькими спикерами, с плохим микрофоном, с профессиональной терминологией. Вставьте ссылку; если она не открылась, скачайте файл кнопкой на странице и загрузите его. Через несколько минут посмотрите на три вещи. Правильно ли разделены говорящие. Насколько верно записаны фамилии и названия. Читается ли текст без переслушивания. Этого достаточно, чтобы понять, годится ли автоматическая расшифровка вашему материалу, — и это надёжнее любых обещаний на странице сервиса.
Выберите тип записи, формат или рабочий процесс.
Частые вопросы
Откройте нужный ролик на Rutube, скопируйте ссылку из адресной строки и вставьте её в поле загрузки. Сервис извлечёт звук из эфира и вернёт расшифровку с разделением по спикерам и таймкодами. Скачивать видео на компьютер при этом не нужно.
Да, именно для них сценарий и придуман. Многочасовую пресс-конференцию или вебинар не придётся пересматривать целиком: вы получаете текст с метками времени и переходите сразу к нужному моменту. Для загрузки файлом поддерживается размер до 4 ГБ.
Начать можно бесплатно и без карты, чтобы проверить качество на реальном эфире своего канала. Это удобно редакциям и агентствам: вы оцениваете, насколько чисто распознаётся официальная речь, прежде чем ставить сервис на поток.
Русский язык проработан особенно тщательно, поэтому деловые и официальные формулировки читаются связно. Названия ведомств, должности и специфические термины стоит проверить в редакторе — там же можно послушать спорный фрагмент и поправить его вручную.
Да. Помимо текста в DOCX и TXT сервис отдаёт субтитры в SRT и VTT — их остаётся подгрузить к ролику. Авторазбивка учитывает длину строки и скорость чтения, так что подписи не мельтешат и остаются читаемыми на экране.
Сохраните повторяющийся сценарий как шаблон отчёта, а термины канала соберите в базу знаний. Тогда каждый следующий ролик расшифровывается по накатанной, а саммари и action items формируются в едином для всей редакции формате.
Vibe2Text
Загрузите аудио или видео, пока на запуске сервис открыт бесплатно.