
ГАЙД
Расшифровка фокус-группы: как разметить восемь голосов и получить проверяемые цитаты
Полтора часа на восемь голосов — это двенадцать тысяч слов и полный рабочий день ручного набора. Как записать и разметить группу, чтобы цитаты в отчёте проверялись по таймкоду.
Расшифровка фокус-группы начинается с записи: чек-лист подготовки
Расшифровка фокус-группы получается разборчивой не в момент загрузки файла, а в момент, когда вы кладёте телефон в центр стола. Один микрофон на восьмерых даёт восемь голосов в одинаковой реверберации — и человека с дальнего края система слышит примерно так же, как его слышите вы: через раз.
Пройдите по списку до того, как первый участник сядет за стол — тридцать секунд подготовки экономят час вычитки.
- Согласие подписано и лежит рядом. Цель записи, круг тех, кто получит доступ, срок хранения, судьба цитат. Собирать подписи, когда группа уже началась, значит потерять первые пять минут и настрой.
- Заряд и свободное место проверены на обоих устройствах. Полтора часа записи в приличном качестве — это сотни мегабайт. Телефон, вставший на 55-й минуте, обесценивает всю подготовку.
- Авиарежим или «не беспокоить». Входящий звонок обрывает запись на многих телефонах. На диктофоне заодно отключите голосовые подсказки и звук кнопок.
- Два источника вместо одного. Второй телефон или диктофон на противоположном конце стола. Даже если основной файл окажется испорчен, останется дубль — а на тихих участниках вторая дорожка часто разборчивее первой.
- Тестовые тридцать секунд. Запишите, послушайте в наушниках, проверьте, что кондиционер, проектор или холодильник не гудят поверх речи. После группы это уже не чинится.
- Рассадка по голосам. Двоих с похожим тембром сажайте по разные стороны от микрофона, а самого тихого — ближе всех. Разметка ошибается ровно там, где вы сами путаетесь на слух.
- Раунд представлений на запись. Первое, что делают после включения: каждый по кругу называет имя и одну фразу о себе. Это даёт чистый образец голоса каждого участника в начале файла — по нему потом сопоставляют метки с людьми.
- Голосовые метки от модератора. «Переходим ко второму блоку», «последний вопрос» — эти фразы становятся якорями в тексте, по ним стенограмма режется на блоки гайда за минуту.
Онлайн-группа: если платформа умеет писать отдельную дорожку на каждого участника — берите этот вариант, он снимает половину проблем ниже. Агрессивное «улучшение голоса» и шумодав лучше выключить: они вычищают тихие реплики вместе с шумом.
Почему на 6–8 голосах разметка сыпется
Автоматическое разделение спикеров устроено проще, чем кажется: запись режется на короткие фрагменты, для каждого считается «отпечаток» голоса, похожие отпечатки собираются в кластеры. Один кластер — один спикер. Пока людей двое, задача почти арифметическая. На восьмерых отпечатки становятся соседями, и кластеры начинают перетекать друг в друга.
Это видно на цифрах. В открытом бенчмарке DIHARD III системы диаризации гоняют на одиннадцати типах записей. Там, где говорят один-два человека, медианная ошибка разметки держится ниже 10 %; на телефонных диалогах и клинических интервью она уже 10–20 %; а на совещаниях, любительском видео и разговорах в ресторане медиана уходит на 35–45 %. Лучший опубликованный результат 2025 года на этом корпусе — 14,49 % в среднем по всем типам записей, но соотношение между ними никуда не делось: многоголосый разговор за общим столом остаётся в разы более трудным материалом, чем беседа вдвоём.

Главная причина — наложенная речь. Когда двое говорят одновременно, фрагмент содержит оба голоса, и приписать его кому-то одному нельзя без потерь. Материала этого много: в том же DIHARD III на пересекающуюся речь приходится порядка 9–10 % всего времени, и под такие участки строят специальные модели сегментации, которые изначально допускают, что в кадре несколько говорящих. А в фокус-группе перебивания — не сбой, а сам метод: спор и есть то, ради чего вы всех собрали.
Отсюда рабочая карта: где именно разметка ошибается на группе и что с этим делать за пару минут.
| Что происходит на записи | Что делает разметка | Что делаете вы |
|---|---|---|
| Двое перебивают друг друга | Кусок уходит одному из них или пропадает | Слушаете фрагмент по таймкоду и дописываете вторую реплику руками |
| Тихий участник далеко от микрофона | Реплики приклеиваются к соседу | Идёте по его метке подряд и переназначаете спорные строки |
| Человек засмеялся, перешёл на шёпот | Один участник распадается на две метки | Объединяете метки в редакторе — подпись меняется по всему тексту |
| Два похожих голоса | Две метки схлопываются в одну | Разводите по раунду представлений: там у каждого чистый образец |
| «Угу», «да-да», смешки в фоне | Появляются метки-однодневки на пару реплик | Игнорируете: на выводы они не влияют, чистить их — трата времени |
И главное правило экономии: не вычитывайте всё. Вычитывайте те места, откуда пойдут цитаты, и все спорные. Идеальная стенограмма нужна суду, а вам нужны проверяемые цитаты. Чем стенограмма отличается от протокола и транскрипта — в разборе протокол, стенограмма или транскрипт.

Модератор и участники: как размечать реплики
Первое действие после расшифровки — не вычитка, а переименование меток. И переименовывать лучше не в имена, а в коды: «Модератор», «Р1», «Р2» и так далее. Сервис подставляет имена прямо из разговора, если участники представлялись, — на этапе сверки это удобно, но перед выгрузкой отчёта имена всё равно уходят, а коды остаются.
Связка «Р3 = Марина, 34, Казань, пользуется приложением полгода» живёт в отдельном файле, к которому есть доступ у вас и у заказчика исследования, — но не в транскрипте, который вы отправляете в общий чат проекта.
Реплики модератора не выбрасывайте, даже когда хочется сократить объём. Причин три.
- Вопрос — это контекст ответа. Цитата «да, конечно, для меня это важно» без предшествующего вопроса не значит ничего и в отчёте выглядит подтасовкой.
- По репликам модератора видно ваши ошибки. Наводящий вопрос, подсказанный ответ, слишком быстрый переход к следующей теме — это разбирается только по тексту и только постфактум.
- Границы блоков гайда. Голосовые метки модератора превращают сплошную стенограмму в структуру, по которой потом собирается отчёт.
Вычитка: что править, а что не трогать
Идти по стенограмме сверху вниз — худший из возможных порядков: к сороковой минуте внимание кончается ровно там, где начинается самое интересное. Идите по блокам гайда, начиная с того, ради которого группу собирали.
Править обязательно: имена собственные, названия брендов и конкурентов, продуктовые термины, числа и суммы. Именно сюда и уходит вычитка: таких слов мало в обычной речи, и на слух вместо незнакомого подставляется ближайшее знакомое. Спорное место переслушивается прямо в редакторе: нажали на строку — зазвучал этот фрагмент, правка занимает секунды.
Не трогать: живую речь. «Ну, типа, я не знаю, мне как-то не зашло» — это данные, а не мусор. Причёсанная цитата читается солиднее и стоит ровно вдвое меньше: по ней невозможно понять, насколько уверенно человек говорил. Дословность — единственное, чем вы отобьётесь, когда заказчик усомнится в цитате.
Особый случай: диалектизмы, региональные словечки и сильный акцент. Здесь автоматика подставляет похоже звучащее знакомое слово вместо незнакомого — и смысл меняется на противоположный. Такие места слышно по неестественности фразы: если участник вдруг заговорил канцеляритом, вы, скорее всего, читаете ошибку распознавания.
- Записьдва источника, раунд представлений
- Транскриптреплики, участники, время
- Разметкароли, коды, блоки гайда
- Кодированиецитаты с якорями на запись
Кодирование цитат и сборка выводов
Единица анализа — не реплика и не участник, а цитата с четырьмя полями: код, текст, участник, таймкод. Последнее поле обычно и забывают, а оно самое ценное: через месяц, когда заказчик усомнится в выводе, вы возвращаетесь не к «где-то в третьей группе», а к 00:47:12. Что с этими цитатами делает заказчик исследования — в разборе про анализ фокус-группы по стенограмме, а не по пересказу.
- Первый проход — открытое кодирование: читаете подряд и помечаете куски своими словами, не пытаясь сразу выстроить систему.
- Второй проход — сведение: близкие коды объединяются в темы, одинокие остаются как есть, их обычно и стоит перечитать внимательнее.
- Третий проход — расхождения: ищете места, где два участника сказали противоположное. Там, где группа спорила, лежит гипотеза; там, где все кивали, лежит социальная норма.
- Финал — сборка: каждый вывод отчёта подпирается двумя-тремя цитатами с таймкодами, остальное идёт в приложение.
Два подвоха, на которых спотыкаются даже опытные исследователи. Первый: частота не равна важности. Восемь человек — не выборка, и «упомянули пять раз» здесь не аргумент. Одно «я после этого удалил приложение» весит больше пяти вежливых «ну, нормально».
Второй — групповой эффект. В фокус-группе мнения выравниваются: кто высказался первым, тот и задал рамку, а остальные присоединяются. Поэтому в таблице кодов полезно помечать, чья реплика была первой в теме. Расхождение между групповым обсуждением и глубинными интервью один на один обычно и есть самая интересная находка исследования. Та же логика работает в найме, где кандидатов сравнивают по записям, а не по впечатлению.
Когда групп больше одной
Волна из четырёх групп — это шесть часов записи и четыре стенограммы, между которыми надо ходить. Вопрос «а что вообще говорили про цену?» превращается в перечитывание всего массива.
Здесь работают две вещи. Поиск по архиву записей находит формулировку сразу во всех расшифровках — вы получаете список мест, а не воспоминание о том, что «кто-то что-то говорил». А чат по записи отвечает на вопрос по содержанию и подкрепляет ответ прямыми цитатами с таймкодами, которые тут же можно переслушать.

Из стенограммы в отчёт
Отчёт исследования пишет исследователь — но черновик структуры можно не собирать руками. Автоматическое саммари по записи даёт карту тем и ключевые тезисы с привязкой к таймкодам: это не выводы, а оглавление материала, по которому удобно распределять цитаты.

Финальный документ обычно уходит в DOCX: приложение со стенограммой, таблица кодов, отчёт с цитатами. Стенограмму в приложение кладут уже обезличенную — с кодами вместо имён. Какие ещё форматы выгрузки бывают и когда нужен каждый — разобрано отдельно.

Персональные данные и анонимизация
Запись фокус-группы — это персональные данные: голос, имя, место работы, возраст, рассказы о здоровье, деньгах и семье. Плюс расшифровка, где всё это лежит уже в текстовом, удобном для поиска виде.
Частый страх исследователей — «голос это биометрия, значит всё сложно». Роскомнадзор в письме от 10.02.2020 № 08АП-6782, к которому приложены практические рекомендации по применению 152-ФЗ к биометрическим данным, исходит из того, что физиологические и биологические характеристики становятся биометрическими персональными данными тогда, когда оператор использует их для установления личности. Расшифровка ради текста таким использованием не является. Согласия на запись и прочих требований 152-ФЗ это не отменяет — просто снимает лишнюю панику.
Рабочий минимум, который закрывает большинство ситуаций:
- Согласие берётся до включения записи и в нём написано понятным языком: зачем запись, кто получит доступ, сколько она хранится, в каком виде цитаты попадут в отчёт.
- Ключ соответствия хранится отдельно. Файл «Р1 = Иван Петров» — не в той же папке, что транскрипты, и не в общем чате проекта.
- В отчёт идут псевдонимы и обобщённые описания: «участница, 30–35 лет, крупный город» вместо «Марина, 34, Казань».
- Косвенные идентификаторы вычищаются. Должность в маленькой компании, редкий диагноз, название школы — по связке из трёх таких деталей человека узнают коллеги, даже если имени нет.
- Данные удаляются или обезличиваются, когда цель обработки достигнута, — это прямое требование закона, а не пожелание.
- Видеозапись — сложнее аудио. Лицо в кадре обезличить труднее, чем имя в тексте, поэтому видео чаще всего удаляют сразу после расшифровки, оставляя аудио и текст.
Запись есть — стенограммы нет
Vibe2Text забирает файл фокус-группы или глубинного интервью и возвращает текст с разделением участников и таймкодами: метки переименовываются в роли, цитаты кликаются до нужной секунды, поиск идёт по всему архиву записей.
Расшифровать записьБесплатный старт без карты. Файлы до 4 ГБ и до 6 часов, русский и английский. Выгрузка: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.
Частые вопросы
Сколько времени занимает расшифровка фокус-группы?
Машинная расшифровка полуторачасовой записи занимает минуты. Дальше идёт работа, которую не автоматизировать: переименовать метки участников в роли, вычитать блоки, откуда пойдут цитаты, и проверить спорные места на слух. На практике это ещё час-полтора против полного рабочего дня, если набирать текст руками.
Как разделить восемь спикеров в записи фокус-группы?
Схема такая: попросить участников представиться в начале записи, получить расшифровку с метками, сопоставить метки с людьми по этому вступлению и переименовать в роли — подпись меняется сразу по всему тексту. Дальше правятся ровно два места: перебивания и реплики самого тихого участника. На восьми голосах черновой разметки больше, чем на диалоге вдвоём, — это свойство любой автоматической разметки, измеренное на открытых бенчмарках, и раунд представлений закрывает большую его часть.
Чем расшифровка глубинного интервью отличается от фокус-группы?
Технически — тем, что голосов два, а не восемь: разметка на диалоге ошибается в разы реже и почти не требует правки. Методически — тем, что в интервью важна логика рассуждения одного человека, поэтому реплики интервьюера нужны целиком, включая паузы и уточняющие вопросы.
Что делать с перебиваниями и наложением речи?
Идти по таймкодам: когда говорят двое сразу, фрагмент достаётся одному из них — спорное место переслушивается кликом по строке, вторая реплика дописывается руками. Таких мест обычно немного, и почти все приходятся на самые эмоциональные куски обсуждения, которые вы и так собирались слушать. Наложенная речь — общее ограничение автоматической разметки: в открытых бенчмарках на неё приходится порядка десятой части времени записи.
Нужно ли согласие участников на запись и как анонимизировать цитаты?
Согласие берётся до начала записи и описывает цель, срок хранения и то, в каком виде цитаты попадут в отчёт. Анонимизация — это не только замена имени на код: убираются косвенные идентификаторы (редкая должность, название компании, связка «город плюс возраст плюс профессия») и имена третьих лиц, которых участники упоминают в рассказах. Ключ соответствия кодов и имён хранится отдельно от транскриптов.
В каком формате выгружать стенограмму для отчёта?
DOCX — для приложения к отчёту и для правки в Word. Markdown или JSON — если стенограмма едет в таблицу кодирования или в другой инструмент анализа. TXT — для архива проекта и поиска. Таймкоды сохраняются в выгрузке, поэтому ссылка на момент записи остаётся рабочей и вне сервиса.
А если группа шла на двух языках?
Русский и английский распознаются, язык определяется автоматически. Смешанные реплики стоит проверить отдельно: переключение языка внутри одной фразы — сложный случай для любой системы, и именно там чаще всего появляются странные слова.
Проверено 13 августа 2026: разброс ошибки диаризации по типам записей (медиана ниже 10 % на 1–2 говорящих, 10–20 % на телефонных диалогах и клинических интервью, 35–45 % на совещаниях, веб-видео и записях в ресторане) и доля пересекающейся речи — по обзору бенчмарка DIHARD III (Ryant et al., Interspeech 2021); результат 14,49 % на том же корпусе — по работе Broughton & Samarakoon «Pushing the Limits of End-to-End Diarization» (Interspeech 2025); модели сегментации под перекрывающуюся речь — Bredin & Laurent (Interspeech 2021); правовая часть — 152-ФЗ «О персональных данных» и письмо Роскомнадзора от 10.02.2020 № 08АП-6782.