Расшифровка фокус-группы: как разметить восемь голосов и получить проверяемые цитаты

ГАЙД

Расшифровка фокус-группы: как разметить восемь голосов и получить проверяемые цитаты

Полтора часа на восемь голосов — это двенадцать тысяч слов и полный рабочий день ручного набора. Как записать и разметить группу, чтобы цитаты в отчёте проверялись по таймкоду.

Расшифровка фокус-группы начинается с записи: чек-лист подготовки

Расшифровка фокус-группы получается разборчивой не в момент загрузки файла, а в момент, когда вы кладёте телефон в центр стола. Один микрофон на восьмерых даёт восемь голосов в одинаковой реверберации — и человека с дальнего края система слышит примерно так же, как его слышите вы: через раз.

Пройдите по списку до того, как первый участник сядет за стол — тридцать секунд подготовки экономят час вычитки.

  1. Согласие подписано и лежит рядом. Цель записи, круг тех, кто получит доступ, срок хранения, судьба цитат. Собирать подписи, когда группа уже началась, значит потерять первые пять минут и настрой.
  2. Заряд и свободное место проверены на обоих устройствах. Полтора часа записи в приличном качестве — это сотни мегабайт. Телефон, вставший на 55-й минуте, обесценивает всю подготовку.
  3. Авиарежим или «не беспокоить». Входящий звонок обрывает запись на многих телефонах. На диктофоне заодно отключите голосовые подсказки и звук кнопок.
  4. Два источника вместо одного. Второй телефон или диктофон на противоположном конце стола. Даже если основной файл окажется испорчен, останется дубль — а на тихих участниках вторая дорожка часто разборчивее первой.
  5. Тестовые тридцать секунд. Запишите, послушайте в наушниках, проверьте, что кондиционер, проектор или холодильник не гудят поверх речи. После группы это уже не чинится.
  6. Рассадка по голосам. Двоих с похожим тембром сажайте по разные стороны от микрофона, а самого тихого — ближе всех. Разметка ошибается ровно там, где вы сами путаетесь на слух.
  7. Раунд представлений на запись. Первое, что делают после включения: каждый по кругу называет имя и одну фразу о себе. Это даёт чистый образец голоса каждого участника в начале файла — по нему потом сопоставляют метки с людьми.
  8. Голосовые метки от модератора. «Переходим ко второму блоку», «последний вопрос» — эти фразы становятся якорями в тексте, по ним стенограмма режется на блоки гайда за минуту.

Онлайн-группа: если платформа умеет писать отдельную дорожку на каждого участника — берите этот вариант, он снимает половину проблем ниже. Агрессивное «улучшение голоса» и шумодав лучше выключить: они вычищают тихие реплики вместе с шумом.

Почему на 6–8 голосах разметка сыпется

Автоматическое разделение спикеров устроено проще, чем кажется: запись режется на короткие фрагменты, для каждого считается «отпечаток» голоса, похожие отпечатки собираются в кластеры. Один кластер — один спикер. Пока людей двое, задача почти арифметическая. На восьмерых отпечатки становятся соседями, и кластеры начинают перетекать друг в друга.

Это видно на цифрах. В открытом бенчмарке DIHARD III системы диаризации гоняют на одиннадцати типах записей. Там, где говорят один-два человека, медианная ошибка разметки держится ниже 10 %; на телефонных диалогах и клинических интервью она уже 10–20 %; а на совещаниях, любительском видео и разговорах в ресторане медиана уходит на 35–45 %. Лучший опубликованный результат 2025 года на этом корпусе — 14,49 % в среднем по всем типам записей, но соотношение между ними никуда не делось: многоголосый разговор за общим столом остаётся в разы более трудным материалом, чем беседа вдвоём.

Расшифровка групповой дискуссии: реплики с метками говорящих и временем каждой
Так выглядит разметка, которую потом правят: у каждой реплики свой говорящий и своя секунда, поэтому спорную строку слышно сразу.

Главная причина — наложенная речь. Когда двое говорят одновременно, фрагмент содержит оба голоса, и приписать его кому-то одному нельзя без потерь. Материала этого много: в том же DIHARD III на пересекающуюся речь приходится порядка 9–10 % всего времени, и под такие участки строят специальные модели сегментации, которые изначально допускают, что в кадре несколько говорящих. А в фокус-группе перебивания — не сбой, а сам метод: спор и есть то, ради чего вы всех собрали.

Один микрофон в центре слышит восьмерых по-разному: дальние тише ближних, а перебивки накладываются друг на друга. Отсюда и предсказуемые ошибки разметки.

Отсюда рабочая карта: где именно разметка ошибается на группе и что с этим делать за пару минут.

Что происходит на записиЧто делает разметкаЧто делаете вы
Двое перебивают друг другаКусок уходит одному из них или пропадаетСлушаете фрагмент по таймкоду и дописываете вторую реплику руками
Тихий участник далеко от микрофонаРеплики приклеиваются к соседуИдёте по его метке подряд и переназначаете спорные строки
Человек засмеялся, перешёл на шёпотОдин участник распадается на две меткиОбъединяете метки в редакторе — подпись меняется по всему тексту
Два похожих голосаДве метки схлопываются в однуРазводите по раунду представлений: там у каждого чистый образец
«Угу», «да-да», смешки в фонеПоявляются метки-однодневки на пару репликИгнорируете: на выводы они не влияют, чистить их — трата времени

И главное правило экономии: не вычитывайте всё. Вычитывайте те места, откуда пойдут цитаты, и все спорные. Идеальная стенограмма нужна суду, а вам нужны проверяемые цитаты. Чем стенограмма отличается от протокола и транскрипта — в разборе протокол, стенограмма или транскрипт.

Карточки говорящих с числом сегментов — место, где на групповой записи видно склейку
На шести-восьми голосах метки разъезжаются чаще всего, и перекос заметен именно здесь. Отсюда же они переименовываются в коды: «Модератор», «Р1», «Р2».

Модератор и участники: как размечать реплики

Первое действие после расшифровки — не вычитка, а переименование меток. И переименовывать лучше не в имена, а в коды: «Модератор», «Р1», «Р2» и так далее. Сервис подставляет имена прямо из разговора, если участники представлялись, — на этапе сверки это удобно, но перед выгрузкой отчёта имена всё равно уходят, а коды остаются.

Связка «Р3 = Марина, 34, Казань, пользуется приложением полгода» живёт в отдельном файле, к которому есть доступ у вас и у заказчика исследования, — но не в транскрипте, который вы отправляете в общий чат проекта.

Реплики модератора не выбрасывайте, даже когда хочется сократить объём. Причин три.

  • Вопрос — это контекст ответа. Цитата «да, конечно, для меня это важно» без предшествующего вопроса не значит ничего и в отчёте выглядит подтасовкой.
  • По репликам модератора видно ваши ошибки. Наводящий вопрос, подсказанный ответ, слишком быстрый переход к следующей теме — это разбирается только по тексту и только постфактум.
  • Границы блоков гайда. Голосовые метки модератора превращают сплошную стенограмму в структуру, по которой потом собирается отчёт.
В стенограмме, которая уходит в общий чат проекта, имён быть не должно. Коды удобны и на анализе: видно, кто говорил, без лишних персональных данных.

Вычитка: что править, а что не трогать

Идти по стенограмме сверху вниз — худший из возможных порядков: к сороковой минуте внимание кончается ровно там, где начинается самое интересное. Идите по блокам гайда, начиная с того, ради которого группу собирали.

Править обязательно: имена собственные, названия брендов и конкурентов, продуктовые термины, числа и суммы. Именно сюда и уходит вычитка: таких слов мало в обычной речи, и на слух вместо незнакомого подставляется ближайшее знакомое. Спорное место переслушивается прямо в редакторе: нажали на строку — зазвучал этот фрагмент, правка занимает секунды.

Не трогать: живую речь. «Ну, типа, я не знаю, мне как-то не зашло» — это данные, а не мусор. Причёсанная цитата читается солиднее и стоит ровно вдвое меньше: по ней невозможно понять, насколько уверенно человек говорил. Дословность — единственное, чем вы отобьётесь, когда заказчик усомнится в цитате.

Особый случай: диалектизмы, региональные словечки и сильный акцент. Здесь автоматика подставляет похоже звучащее знакомое слово вместо незнакомого — и смысл меняется на противоположный. Такие места слышно по неестественности фразы: если участник вдруг заговорил канцеляритом, вы, скорее всего, читаете ошибку распознавания.

Причёсанная цитата читается солиднее и стоит вдвое меньше: по ней не видно, насколько уверенно говорил человек.
  1. Записьдва источника, раунд представлений
  2. Транскриптреплики, участники, время
  3. Разметкароли, коды, блоки гайда
  4. Кодированиецитаты с якорями на запись

Кодирование цитат и сборка выводов

Единица анализа — не реплика и не участник, а цитата с четырьмя полями: код, текст, участник, таймкод. Последнее поле обычно и забывают, а оно самое ценное: через месяц, когда заказчик усомнится в выводе, вы возвращаетесь не к «где-то в третьей группе», а к 00:47:12. Что с этими цитатами делает заказчик исследования — в разборе про анализ фокус-группы по стенограмме, а не по пересказу.

Четвёртое поле забывают чаще остальных, а спор через месяц упирается именно в него: вы возвращаетесь не к «где-то в третьей группе», а к 00:47:12.
  1. Первый проход — открытое кодирование: читаете подряд и помечаете куски своими словами, не пытаясь сразу выстроить систему.
  2. Второй проход — сведение: близкие коды объединяются в темы, одинокие остаются как есть, их обычно и стоит перечитать внимательнее.
  3. Третий проход — расхождения: ищете места, где два участника сказали противоположное. Там, где группа спорила, лежит гипотеза; там, где все кивали, лежит социальная норма.
  4. Финал — сборка: каждый вывод отчёта подпирается двумя-тремя цитатами с таймкодами, остальное идёт в приложение.

Два подвоха, на которых спотыкаются даже опытные исследователи. Первый: частота не равна важности. Восемь человек — не выборка, и «упомянули пять раз» здесь не аргумент. Одно «я после этого удалил приложение» весит больше пяти вежливых «ну, нормально».

Второй — групповой эффект. В фокус-группе мнения выравниваются: кто высказался первым, тот и задал рамку, а остальные присоединяются. Поэтому в таблице кодов полезно помечать, чья реплика была первой в теме. Расхождение между групповым обсуждением и глубинными интервью один на один обычно и есть самая интересная находка исследования. Та же логика работает в найме, где кандидатов сравнивают по записям, а не по впечатлению.

Когда групп больше одной

Волна из четырёх групп — это шесть часов записи и четыре стенограммы, между которыми надо ходить. Вопрос «а что вообще говорили про цену?» превращается в перечитывание всего массива.

Здесь работают две вещи. Поиск по архиву записей находит формулировку сразу во всех расшифровках — вы получаете список мест, а не воспоминание о том, что «кто-то что-то говорил». А чат по записи отвечает на вопрос по содержанию и подкрепляет ответ прямыми цитатами с таймкодами, которые тут же можно переслушать.

Архив расшифровок нескольких групп с поиском по содержанию и числом говорящих
Когда групп больше одной, формулировка ищется сразу по всем расшифровкам. Вы получаете список мест, а не воспоминание о том, что «кто-то что-то говорил».

Из стенограммы в отчёт

Отчёт исследования пишет исследователь — но черновик структуры можно не собирать руками. Автоматическое саммари по записи даёт карту тем и ключевые тезисы с привязкой к таймкодам: это не выводы, а оглавление материала, по которому удобно распределять цитаты.

Структура сводки по записи группы: разделы с итогом, ключевыми моментами и шагами
Не выводы, а карта материала: разделы с итогом, ключевыми моментами и шагами, по которым исследователь раскладывает цитаты.
Текст по участникамРеплики разложены по говорящим, у каждой время. Клик по строке — слышно этот момент записи.
Цитаты с якорямиКаждая цитата привязана к секунде, а не к «где-то в середине». Проверяется за один клик.
Выгрузка под отчётDOCX для документа, Markdown и JSON — для таблицы кодирования, TXT для архива проекта.

Финальный документ обычно уходит в DOCX: приложение со стенограммой, таблица кодов, отчёт с цитатами. Стенограмму в приложение кладут уже обезличенную — с кодами вместо имён. Какие ещё форматы выгрузки бывают и когда нужен каждый — разобрано отдельно.

Выгрузка стенограммы в Word с сохранением имён говорящих и меток времени
Финальный комплект уходит в DOCX: отчёт, таблица кодов и обезличенная стенограмма приложением. Разметку реплик выгрузка не теряет.

Персональные данные и анонимизация

Запись фокус-группы — это персональные данные: голос, имя, место работы, возраст, рассказы о здоровье, деньгах и семье. Плюс расшифровка, где всё это лежит уже в текстовом, удобном для поиска виде.

Частый страх исследователей — «голос это биометрия, значит всё сложно». Роскомнадзор в письме от 10.02.2020 № 08АП-6782, к которому приложены практические рекомендации по применению 152-ФЗ к биометрическим данным, исходит из того, что физиологические и биологические характеристики становятся биометрическими персональными данными тогда, когда оператор использует их для установления личности. Расшифровка ради текста таким использованием не является. Согласия на запись и прочих требований 152-ФЗ это не отменяет — просто снимает лишнюю панику.

Рабочий минимум, который закрывает большинство ситуаций:

  • Согласие берётся до включения записи и в нём написано понятным языком: зачем запись, кто получит доступ, сколько она хранится, в каком виде цитаты попадут в отчёт.
  • Ключ соответствия хранится отдельно. Файл «Р1 = Иван Петров» — не в той же папке, что транскрипты, и не в общем чате проекта.
  • В отчёт идут псевдонимы и обобщённые описания: «участница, 30–35 лет, крупный город» вместо «Марина, 34, Казань».
  • Косвенные идентификаторы вычищаются. Должность в маленькой компании, редкий диагноз, название школы — по связке из трёх таких деталей человека узнают коллеги, даже если имени нет.
  • Данные удаляются или обезличиваются, когда цель обработки достигнута, — это прямое требование закона, а не пожелание.
  • Видеозапись — сложнее аудио. Лицо в кадре обезличить труднее, чем имя в тексте, поэтому видео чаще всего удаляют сразу после расшифровки, оставляя аудио и текст.

Запись есть — стенограммы нет

Vibe2Text забирает файл фокус-группы или глубинного интервью и возвращает текст с разделением участников и таймкодами: метки переименовываются в роли, цитаты кликаются до нужной секунды, поиск идёт по всему архиву записей.

Расшифровать запись

Бесплатный старт без карты. Файлы до 4 ГБ и до 6 часов, русский и английский. Выгрузка: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.

Частые вопросы

Сколько времени занимает расшифровка фокус-группы?

Машинная расшифровка полуторачасовой записи занимает минуты. Дальше идёт работа, которую не автоматизировать: переименовать метки участников в роли, вычитать блоки, откуда пойдут цитаты, и проверить спорные места на слух. На практике это ещё час-полтора против полного рабочего дня, если набирать текст руками.

Как разделить восемь спикеров в записи фокус-группы?

Схема такая: попросить участников представиться в начале записи, получить расшифровку с метками, сопоставить метки с людьми по этому вступлению и переименовать в роли — подпись меняется сразу по всему тексту. Дальше правятся ровно два места: перебивания и реплики самого тихого участника. На восьми голосах черновой разметки больше, чем на диалоге вдвоём, — это свойство любой автоматической разметки, измеренное на открытых бенчмарках, и раунд представлений закрывает большую его часть.

Чем расшифровка глубинного интервью отличается от фокус-группы?

Технически — тем, что голосов два, а не восемь: разметка на диалоге ошибается в разы реже и почти не требует правки. Методически — тем, что в интервью важна логика рассуждения одного человека, поэтому реплики интервьюера нужны целиком, включая паузы и уточняющие вопросы.

Что делать с перебиваниями и наложением речи?

Идти по таймкодам: когда говорят двое сразу, фрагмент достаётся одному из них — спорное место переслушивается кликом по строке, вторая реплика дописывается руками. Таких мест обычно немного, и почти все приходятся на самые эмоциональные куски обсуждения, которые вы и так собирались слушать. Наложенная речь — общее ограничение автоматической разметки: в открытых бенчмарках на неё приходится порядка десятой части времени записи.

Нужно ли согласие участников на запись и как анонимизировать цитаты?

Согласие берётся до начала записи и описывает цель, срок хранения и то, в каком виде цитаты попадут в отчёт. Анонимизация — это не только замена имени на код: убираются косвенные идентификаторы (редкая должность, название компании, связка «город плюс возраст плюс профессия») и имена третьих лиц, которых участники упоминают в рассказах. Ключ соответствия кодов и имён хранится отдельно от транскриптов.

В каком формате выгружать стенограмму для отчёта?

DOCX — для приложения к отчёту и для правки в Word. Markdown или JSON — если стенограмма едет в таблицу кодирования или в другой инструмент анализа. TXT — для архива проекта и поиска. Таймкоды сохраняются в выгрузке, поэтому ссылка на момент записи остаётся рабочей и вне сервиса.

А если группа шла на двух языках?

Русский и английский распознаются, язык определяется автоматически. Смешанные реплики стоит проверить отдельно: переключение языка внутри одной фразы — сложный случай для любой системы, и именно там чаще всего появляются странные слова.

Проверено 13 августа 2026: разброс ошибки диаризации по типам записей (медиана ниже 10 % на 1–2 говорящих, 10–20 % на телефонных диалогах и клинических интервью, 35–45 % на совещаниях, веб-видео и записях в ресторане) и доля пересекающейся речи — по обзору бенчмарка DIHARD III (Ryant et al., Interspeech 2021); результат 14,49 % на том же корпусе — по работе Broughton & Samarakoon «Pushing the Limits of End-to-End Diarization» (Interspeech 2025); модели сегментации под перекрывающуюся речь — Bredin & Laurent (Interspeech 2021); правовая часть — 152-ФЗ «О персональных данных» и письмо Роскомнадзора от 10.02.2020 № 08АП-6782.