Разделение спикеров и диаризация: почему «Спикер 1» — это двое

РАЗБОР

Разделение спикеров и диаризация: почему «Спикер 1» — это двое

Слова распознаны верно, а «Спикер 2» задаёт вопрос и сам на него отвечает. Что ломает разделение спикеров и как записать разговор, чтобы чинить было почти нечего.

«Кто говорил когда» — это отдельная задача

Час созвона, шестеро участников, расшифровка готова за минуты. Читаешь и спотыкаешься: «Спикер 2» задаёт вопрос и сам на него отвечает, а к сорок пятой минуте появляется «Спикер 7», хотя людей было шесть. Слова при этом распознаны нормально — сломалось не распознавание, а диаризация, то есть разделение записи по говорящим.

Разделение спикеров, или диаризация, — отдельная задача поверх расшифровки: разметить запись по времени и сказать, кому принадлежит каждый отрезок. Не «что сказано», а «кто и когда говорил». В исследованиях её так и формулируют — «who spoke when», и в открытых оценках речевых систем она с самого начала шла отдельной строкой от распознавания слов.

Важная деталь: имена в этой задаче не участвуют вовсе. Система не знает, что первый голос принадлежит Ирине, — она знает только, что голос номер один звучал с 00:12 по 00:41 и потом ещё с 01:05. Имена появляются позже и другим способом: их подставляют из самого разговора, если участники представлялись, либо проставляет человек в редакторе.

Отсюда главное следствие. Ошибку в словах видно сразу — фраза выглядит странно, глаз цепляется. Ошибка в разметке говорящих незаметна: текст читается гладко, просто чужая реплика приписана не тому. Её ловят не вычиткой подряд, а прицельно — там, откуда пойдут цитаты, решения и задачи.

Ошибку в словах ловит глаз: фраза перестаёт складываться. Ошибка в разметке говорящих читается гладко — и попадает дальше, в задачи и отчёт, вместе с чужим именем.

Как устроена диаризация: сегментация и группировка голосов

Задача решается в два приёма, и оба делают то же, что делает человек, слушающий запись из чужой переговорной. Разберите механику — и ошибки станут предсказуемыми: вы будете заранее знать, какие места в тексте проверять.

Первый приём — сегментация. Запись просматривается подряд и режется на короткие однородные куски: вот тишина, вот шум кондиционера, вот речь; вот здесь звучание сменилось, значит, тут граница реплики. На этом шаге ещё не важно, кто именно говорит, — важно только, где кончается один отрезок и начинается следующий.

Второй приём — группировка. Каждому речевому отрезку сопоставляется что-то вроде отпечатка голоса: короткое числовое описание того, как звучит этот кусок. Отпечатки сравниваются между собой, похожие собираются в группы. Одна группа — один говорящий. И вот сколько получится групп — отдельная головная боль: число участников системе заранее никто не сообщал. Сильнее всего это видно на записях фокус-групп, где голосов восемь и говорят они вперебой.

  1. Где речьтишина, шум и музыка отсекаются
  2. Где границыпоток режется там, где голос сменился
  3. Похожее к похожемуотрезки собираются в группы по звучанию
  4. Меткикаждой группе — свой спикер
Разметка не режет файл на части — она проставляет, кому принадлежит каждый отрезок времени. Пунктиром обведены два спорных места: там, где говорят одновременно, и там, где реплика слишком коротка.

Из картинки видно, где задача становится неудобной. Отрезок, на котором говорят двое, не принадлежит никому одному. Отрезок в полсекунды содержит слишком мало голоса, чтобы отпечаток на что-то походил. А два голоса близкого тембра, записанные одним микрофоном в одной комнате, дают похожие отпечатки — и группировка складывает их вместе.

Почему это труднее, чем распознать слова

У распознавания слов есть удобное свойство: правильный ответ существует, и он один. Слово либо распознано верно, либо нет, спорить не о чем. У разметки говорящих такого свойства нет сразу в двух местах.

Первое — границы. Спросите двух человек, где кончается реплика, если собеседник начал отвечать, не дослушав, — получите два ответа с расхождением в полсекунды. Открытая методика оценки признаёт это прямо: системе прощают около 0,25 секунды по краям каждого отрезка, потому что более точной разметки не даст и человек. В строгих современных прогонах поблажку убирают и специально засчитывают участки, где говорят одновременно.

Второе — сами метки. «Спикер 1» и «Спикер 2» — номера групп, и единственно правильной нумерации не существует: при сравнении с эталоном метки сначала сопоставляют между собой наилучшим образом и только потом считают расхождения. Для читателя это значит простую вещь: номер спикера — не свойство человека, а ярлык, который имеет смысл только внутри одной расшифровки.

И третье: ошибка здесь не одна, а трёх сортов. Система может пропустить речь, посчитав её тишиной. Может услышать речь там, где её не было — в шуме, музыке, кашле. И может отдать отрезок не тому говорящему. Первые две беды приходят от качества записи, третья — от похожести голосов.

Отсюда понятно, почему трудность растёт быстрее числа участников. Спутать можно не человека, а пару голосов, а пар всегда больше, чем людей: у двоих пара одна, у четверых — шесть, у шестерых — пятнадцать. Одновременно тает материал на каждого: в часовом разговоре вдвоём на человека приходится около 30 минут речи, вшестером — около 10 минут, а на дальнего и молчаливого участника и вовсе 2–3 минуты, разбросанные по всему файлу. Меньше голоса — беднее отпечаток, и группировке проще склеить его с чужим.

Сверху — что было на записи, снизу — что получилось. Ошибки бывают трёх сортов сразу, и общая цифра качества складывается из всех трёх: пропуска, лишнего и перепутанного.

Что ломает разделение на практике

Дальше — что портит разметку, в порядке от частого к редкому. Почти всё в списке — про запись, а не про сервис, и почти всё решается до нажатия кнопки «Записать».

  • Наложение реплик. Перебили, поддакнули, договорили за собеседника — и на отрезке два голоса сразу. Отдать его можно только кому-то одному, вторая реплика теряется. В споре на повышенных тонах таких мест десятки подряд.
  • Похожие голоса. Два баритона за одним столом, две коллеги близкого тембра, мать и дочь на семейном интервью. Человек различает их по манере и содержанию речи — разметке содержание недоступно.
  • Короткие вставки. «Угу», «да-да», «секунду» — это 0,3–0,5 секунды звука, а допуск на границах отрезка и так составляет около 0,25 секунды: половину такой реплики съедает уже сама неточность разметки. Материала для отпечатка почти нет, и кусок либо приклеивается к соседней реплике, либо порождает лишнюю метку.
  • Смена микрофона и расстояния. Человек пересел, взял телефон в руку, перешёл на шёпот, засмеялся, надел гарнитуру в середине встречи — голос перестал быть похож сам на себя, и участник распадается на двоих.
  • Один микрофон на всю комнату. Голоса приходят с одинаковым эхом, дальние — ещё и тише. Различия между людьми оказываются меньше, чем между «близко» и «далеко», и участников делит рассадка, а не тембр.
  • Фон и посторонняя речь. Телевизор, опенспейс, коридор, музыка ожидания в начале звонка. Это тоже речь, и она получает свою метку наравне с людьми за столом.
  • Склейки и обрывки. Файл, собранный из двух кусков, или запись, где первые десять минут писались с одного устройства, а остальные — с другого.
Все три сбоя происходят по одной причине: системе не хватает различий в звучании. Первые два правятся в редакторе за секунды, третий чаще всего не стоит трогать вовсе.

Все три сбоя правятся в редакторе за секунды — надо только знать, что их стоит искать. Опаснее незнание: человек читает гладкий текст, не замечает подмены и уносит в отчёт цитату, которую произнёс не тот, на кого она записана.

Реплики расшифровки с нейтральными метками «Спикер 1» и «Спикер 2» и промежутками времени
Метки нейтральные, пока имена не подставлены: спорную реплику находят по времени и переназначают прямо в тексте.

Что делает запись пригодной для разделения

Самый дешёвый способ получить хорошую разметку — не чинить её после, а не сломать при записи. Три-четыре решения, принятые до начала разговора, снимают большую часть будущей правки.

  1. Раздельные дорожки, если платформа их умеет. Когда каждый пишется в свой файл, догадываться не о чем. В Zoom это настройка «Record a separate audio file for each participant»: доступна при записи на компьютер, в облачной её нет.
  2. Разные микрофоны разным людям. Гарнитуры, каждый со своего компьютера, — лучший вариант для встречи: голоса приходят чистыми, громкими и заведомо различными.
  3. Микрофон ближе к людям, а не в центр стола. Один телефон посреди переговорной ставит всех в одинаковые условия — ровно те, в которых голоса и путаются.
  4. Рассадка по голосам. Двоих с похожим тембром сажайте по разные стороны от микрофона, самого тихого — ближе всех. Разметка ошибается там же, где вы сами путаетесь на слух.
  5. Круг представлений в первую минуту. Каждый называет имя и одну фразу о себе. Это чистый образец голоса в начале файла: по нему вы сопоставите метки с людьми, а сервису будет откуда взять имена.
  6. Договориться говорить по очереди. Звучит наивно, но на встрече с ведущим работает: ведущий передаёт слово, и наложений становится в разы меньше.
  7. Не включать агрессивное «улучшение голоса». Шумодав и автоусиление выравнивают всё подряд, включая различия между голосами, — а разметка живёт как раз этими различиями.
Как записаноЧто с разделениемЧто сделать
Отдельная дорожка на каждогоРазделять нечего: кто где говорит, известно из записиВзять этот вариант, если платформа предлагает
Гарнитуры, каждый со своего ноутбукаГолоса чистые и разные — надёжнее всегоНичего: только переименовать метки в роли
Телефонный звонок в два каналаСтороны разложены каналами, ошибиться негдеПроверить, что запись стерео, а не сведена в моно
Один микрофон на переговорнуюОдинаковое эхо у всех, ошибки на дальнихПосадить тихих ближе, попросить представиться
Телефон на столе, громкая связьХудший случай: эхо, перебивания, далёкие голосаВести вторую запись и вычитывать спорные места

Последняя строка таблицы упирается в дублирующую запись, и она стоит дёшево. Диктофон в телефоне пишет речь примерно в 64 кбит/с; час такой записи — это 64 × 3600 ÷ 8 ÷ 1000 ≈ 29 МБ, а шесть часов конференции — около 173 МБ, меньше одного ролика, снятого тем же телефоном. Вторая дорожка, лежащая ближе к столу, чем ноутбук ведущего, снимает половину спорных мест: у неё другое расстояние до говорящих, и голоса, слипшиеся на основной записи, на ней часто расходятся.

Отдельно про онлайн-встречи. Там, где запись ведёт сама платформа, каждый говорит в свой микрофон — половина задачи решена до расшифровки. Хуже всего ставший обычным гибрид: часть команды в переговорной вокруг одного ноутбука, часть удалённо. Комнатные голоса сливаются, удалённые различаются прекрасно — в тексте это выглядит так, будто в офисе сидел один очень разговорчивый человек.

Почему в телефонном звонке двух каналов иногда достаточно

Телефонный разговор — редкий случай, когда задачу можно не решать вовсе. У звонка ровно две стороны, и многие системы записи пишут каждую в свой канал: одну в левый, другую в правый. Разметка тогда получается из самого файла, а не из анализа голосов, и ошибиться в ней негде.

Проверить просто: откройте файл в плеере и послушайте каналы по отдельности. В одном звучите только вы, в другом только собеседник — повезло. Оба голоса одинаково слышны в обоих каналах — запись свели в моно, и стороны придётся различать по голосу, как везде.

Если стороны записаны в разные каналы, задача решена до расшифровки. Пунктирная полоса — обычный случай: оба голоса в обоих каналах, и разметку придётся считать по звучанию.

Расшифровка записи звонка и без раздельных каналов выходит чище, чем расшифровка совещания: голосов два, длинных наложений мало. Зато телефонный звук приносит свою беду — узкую полосу, в которой стирается часть различий между голосами.

У канального разделения есть границы, и о них лучше знать заранее.

  • Конференция на три стороны. В «канале клиента» оказываются двое, и внутри него всё возвращается к обычной задаче.
  • Перевод звонка. Во второй половине записи в том же канале говорит уже другой сотрудник: формально один «спикер», фактически двое.
  • Громкая связь. Голос собеседника долетает до вашего микрофона и попадает в оба канала сразу.
  • Диктофон рядом с телефоном. Канал один, и это худший вариант: свой голос громкий, чужой — далёкий и глухой.

Как чинить результат руками

Правка занимает минуты, если идти в правильном порядке. На записи разговора один на один всё сводится к переименованию двух подписей; на встрече вшестером спорных мест будет больше, но и там их обычно меньше десятка.

  1. Начните с первой минуты. Если участники представлялись, там сопоставляются сразу все метки: услышали «меня зовут Олег» — знаете, кто такой «Спикер 3».
  2. Переименуйте метки в роли, а не в имена. «Клиент», «Модератор», «Кандидат» читаются быстрее имён и не требуют помнить, кто есть кто. Подпись меняется сразу по всему тексту.
  3. Объедините метки, оказавшиеся одним человеком. Классический случай — участник, распавшийся на двоих после того, как пересел или перешёл на шёпот.
  4. Удалите метки-однодневки. Спикер, у которого во всём часовом файле три реплики по одному слову, почти наверняка не человек: поддакивание, робот меню, голос из коридора.
  5. Спорные места правьте точечно, по таймкодам. Клик по строке — звучит именно этот фрагмент. Идти подряд от начала не надо: к сороковой минуте внимание кончится ровно там, где начнётся важное.
  6. Остановитесь раньше, чем захочется. Безупречная разметка нужна лингвисту и суду. Вам нужны верные подписи там, откуда пойдут цитаты и задачи, — обычно это несколько мест на весь разговор.
Панель спикеров: сколько речи досталось каждой метке и кнопка распознавания имён
Здесь видно, сколько речи досталось каждой метке, — и сразу заметно, если один «Спикер» набрал вдвое больше остальных. Отсюда же метки переименовываются по всему тексту разом.

Правило, экономящее больше всего времени: вычитывать не текст, а выводы. Если из часовой встречи вы понесёте дальше пять решений и семь задач, проверять надо семь мест — те, где кто-то что-то на себя взял. Каждое такое место — это переслушать 20–30 секунд по таймкоду, то есть 5–7 минут на всю встречу против часа сплошной вычитки. Остальное может остаться черновым.

Что даёт правильная разметка, кроме опрятного текста

Разделение говорящих — не косметика. От него зависит всё, что строится поверх расшифровки, и ошибки в нём наследуются дальше молча.

Ошибку в подписи в готовом отчёте уже не видно: там будет аккуратная строка «Олег — смета — четверг», просто с чужим именем. Поэтому проверять разметку стоит до рассылки и ровно там, откуда пойдут задачи и цитаты.

Разметка — не косметика: на неё опирается всё, что строится поверх расшифровки. В готовом отчёте останется аккуратная строка «смета — четверг», просто с чужим именем.
Задачи с владельцами«Подготовлю смету к четвергу» становится задачей с именем, только если известно, кто это сказал.
Цитата с авторомНажали на строку — прозвучал именно этот фрагмент записи. Проверка занимает секунду, а не перемотку.
Поиск по ролямПо архиву ищется не «встреча от вторника», а всё, что говорил клиент, — в любой из сорока записей.
Ответ ИИ-помощника по записи: пересказ разговора, собранный поверх разметки говорящих
Всё, что собирается поверх расшифровки, наследует разметку говорящих. Перепутанные метки дадут аккуратный текст с чужим именем — и заметить это в готовом документе уже нельзя.

Дальше эффект накапливается. Расшифровка без разметки отвечает на вопрос «что прозвучало», с разметкой — на вопрос «кто это сказал»: спор «я такого не обещал» заканчивается за секунду, когда рядом с цитатой стоят имя и время. А когда записей сорок, вопрос «что клиент говорил про сроки» превращается в обычный поиск по архиву — но только там, где в тексте видно, где клиент, а где менеджер.

Транскрипт, в котором видно, кто что сказал

Загрузите запись встречи, интервью или звонка — Vibe2Text вернёт текст с разделением говорящих и таймкодами. Метки переименовываются в роли одним движением, спорные места слушаются кликом по строке, а поверх текста собираются решения и задачи с владельцами и сроками.

Разделить спикеров в записи

Бесплатный старт без карты, файлы до 4 ГБ и до 6 часов, русский и английский. Выгрузка: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.

Частые вопросы

Что такое диаризация простыми словами?

Это разметка записи по говорящим: сервис определяет, кому принадлежит каждый отрезок времени, и раскладывает реплики по «Спикер 1», «Спикер 2» и так далее. Имена в самой задаче не участвуют — их подставляют потом, из разговора или руками. Второе название той же вещи — разделение спикеров.

Чем разделение спикеров отличается от распознавания речи?

Распознавание отвечает на вопрос «что сказано», разделение — на вопрос «кто и когда говорил». Задачи решаются рядом, но ломаются от разных причин: слова портят плохой звук и незнакомые фамилии, разметку — похожие голоса, перебивания и один микрофон на всех. Поэтому текст вполне может быть верным при перепутанных подписях, и наоборот.

Почему в транскрипте спикеров больше, чем было людей?

Система не получает список участников — она выводит число голосов из записи. Лишнюю метку обычно получает не человек: поддакивание в полсекунды, голос из коридора, робот голосового меню. Второй частый источник — участник, который пересел или перешёл на шёпот: голос перестал быть похож сам на себя, и он распался на двоих. Лишние подписи удаляются, распавшиеся объединяются — обе операции занимают секунды.

Почему два собеседника слиплись в одного «Спикера 1»?

Так бывает, когда голоса близки по тембру, а условия записи одинаковые: один микрофон, одна комната, одинаковое расстояние. Различий, по которым голоса разводят, почти не остаётся. Помогает не правка постфактум, а сама запись: разные микрофоны, рассадка по разные стороны от микрофона, круг представлений в начале. Если запись уже сделана, спорные отрезки находят по таймкодам и переназначают вручную.

Сколько говорящих можно разделить в одной записи?

Жёсткого потолка нет, но надёжность падает с каждым новым голосом. Диалог размечается почти без ошибок, встреча на четверых требует нескольких правок, обсуждение на шестерых-восьмерых — уже отдельная работа. Дело не в количестве самом по себе: с числом участников растёт и число наложений, и вероятность встретить два похожих голоса.

Нужно ли что-то включать, чтобы получить транскрипт по спикерам?

Нет, разделение работает по умолчанию: в готовой расшифровке реплики уже разложены по говорящим, у каждой стоит время от начала записи. Дальше вы переименовываете метки в роли или имена — подпись меняется сразу по всему тексту — и правите спорные места, кликая по строке и слушая именно этот фрагмент.

Можно ли подставить имена вместо «Спикер 1» автоматически?

Если участники представлялись вслух, имена подтягиваются из самого разговора: фраза «меня зовут Олег» в первой минуте работает лучше любой настройки. Когда представлений не было, подписи остаются нейтральными — неоткуда узнать имя, которое ни разу не прозвучало. Тогда метки переименовывают в редакторе, и удобнее не в имена, а в роли.

Проверено 14 августа 2026: задача «who spoke when» как отдельная от распознавания слов — по описанию серии открытых оценок NIST Rich Transcription (2002–2009); состав ошибки разметки из трёх частей (пропущенная речь; речь, которой не было; отрезок, отданный не тому говорящему), допуск около ±250 мс на границах реплик и строгий вариант оценки без него и с учётом наложенной речи — по открытым описаниям принятой там методики подсчёта; настройка «Record a separate audio file for each participant» доступна при записи на компьютер, но не в облачной — по справке Zoom; запись разговора в стерео, где входящее и исходящее направления попадают в разные каналы, — по руководствам по настройке записи в телефонных станциях. Вес дублирующей записи посчитан в тексте от битрейта 64 кбит/с, обычного для речевого режима диктофона: 64 × 3600 ÷ 8 ÷ 1000 ≈ 29 МБ за час; число пар голосов — это n × (n − 1) ÷ 2.