
РАЗБОР
Перебивают друг друга на записи: что происходит с расшифровкой и что делать
Спор на совещании, панель на четверых, семейный разговор на повышенных тонах. Что случается с текстом на перекрытых кусках, где проходит предел разбора и как размечать места, в которых говорили хором.
Перебивают друг друга: что происходит с расшифровкой на таком куске
Спор на совещании выглядит в тексте узнаваемо: три реплики подряд отданы одному человеку, посреди чужой фразы висит обрывок «да подожди», а решение, которое вроде бы приняли, приписано не тому, кто его предложил. Когда на записи перебивают друг друга, ломается не распознавание слов — ломается ответ на вопрос, кто это сказал. И чинится это не там, где обычно ищут.
Первое, что стоит знать: наложение — не сбой разговора, а его норма. В открытом исследовании записей совещаний речь резали на куски без пауз длиннее 500 мс и смотрели, сколько таких кусков хотя бы частично пересекается с чужой речью. На живых обсуждениях с открытым обменом репликами перекрытыми оказались 54,4 % кусков и 17,0 % слов; на совещаниях, где разговор ведёт один человек, — 31,4 % и 8,8 %. Телефонные разговоры двоих дали ту же картину: 53–54 % кусков и около 12 % слов. То есть разговор без наложений — это не обычный разговор, а специально организованный.
Второе — длительность, и она объясняет характер поломок. По измерениям на корпусе разговорной речи 40 % всех переходов от одного говорящего к другому — это не пауза, а наложение, и длится оно недолго: медиана 470 мс при среднем 610 мс. Типичное перекрытие укладывается в 0,5 секунды — это одно слово, «угу» или «да подожди». Поэтому в тексте пропадает не абзац, а вставка, и уезжает не реплика, а её граница: ошибки такого размера при чтении подряд просто не за что зацепить.
- Склейка. Перекрытый кусок целиком достаётся тому, кто звучал громче или ближе к микрофону. В тексте появляется реплика, где один человек задаёт вопрос и сам на него отвечает.
- Потеря. Короткая вставка — «угу», «да-да», «подожди», «нет» — длится полсекунды и приходится ровно на чужую речь. Материала для опознания голоса там почти нет, и вставка либо исчезает, либо приписывается говорящему, поверх которого прозвучала.
- Сдвиг. Граница между репликами уезжает на полсекунды-секунду, и хвост одной фразы оказывается в начале следующей. Смысл при этом не рушится, а автор меняется — самая незаметная и самая дорогая из трёх ошибок.
Почему наложенная речь — самый тяжёлый кусок и для машины, и для человека
Причина физическая, а не программная. Микрофон пишет не голоса, а давление воздуха: два голоса, звучащие вместе, приходят в дорожку одной суммой, и разделить её обратно на слагаемые по одной дорожке нельзя. Дальше начинается арифметика громкости — тот, кто ближе и звонче, забирает кусок себе. Поэтому перекос по громкости и наложение бьют по тексту вместе: разбор случая, когда на записи не слышно собеседника, стоит прочитать сразу после этого.
Отсюда же берётся эффект, который удивляет чаще всего: на записи со спорами иногда появляется лишний говорящий. Смесь двух голосов звучит как третий, незнакомый, и получает собственную метку. Как устроена сама эта задача — что такое диаризация и почему «Спикер 1» — это двое — разобрано отдельно; здесь важно другое: перекрытые куски дают ошибку не потому, что чего-то не хватило, а потому, что правильного ответа на них не существует. Кусок принадлежит двоим сразу.
Человек в наушниках справляется с наложением не лучше, а по-другому: он вытягивает перекрытую фразу знанием темы и контекстом, а не слухом. Профессиональная стенограмма поэтому и содержит пометки в скобках — расшифровщик прямо признаёт, что здесь звучали двое. Открытые измерения показывают тот же разрыв в цифрах. В работе по записям совещаний доля ошибочно распознанных слов на чистых участках составила 41,3 %, на перекрытых — 53,4 %. А на петличном микрофоне, который стоит дальше ото рта и потому лучше слышит соседей, разрыв резче почти вдвое: 38,7 % на чистых участках против 70,4 % на перекрытых. Вывод практический: наложение бьёт тем сильнее, чем дальше микрофон, и петличка на лацкане в этом смысле хуже гарнитуры у рта.

Где голоса накладываются чаще всего
Наложение распределено по записям неравномерно: есть жанры разговора, где оно занимает минуты подряд, и есть такие, где сводится к редкому «угу». Полезно знать заранее, с чем вы имеете дело, — от этого зависит, сколько времени закладывать на разбор.
Важно и то, куда именно вклинивается перебивающий. В том же исследовании 72,9 % вклиниваний пришлись на границы кусков речи — то есть на паузу, когда предыдущий говорящий и так остановился. Но оставшиеся 27 % случились посреди чужой фразы, когда человек говорил непрерывно. Эта четверть и создаёт основную работу при разборе: перебивание на паузе разводится по репликам почти всегда, перебивание внутри фразы — далеко не всегда.
| Что за разговор | Как выглядит наложение | Что страдает сильнее |
|---|---|---|
| Спор на совещании | Плотные пересечения по 5–20 секунд на пике обсуждения | Авторство решений |
| Панельная дискуссия, дебаты | Ведущий вклинивается в ответ, участники договаривают друг за друга | Границы реплик |
| Фокус-группа | Хор согласия после вопроса модератора, реплики с места | Короткие мнения участников |
| Семейный или юридический разговор | Эмоциональные перебивания, повышенный тон, речь поверх речи | Дословность цитат |
| Созвон с задержкой | Двойные старты: оба начинают, оба замолкают, оба начинают снова | Первые слова каждой реплики |
| Телефонная конференция на три стороны | Двое в одном канале, наложение внутри канала | Разделение сторон |
Крайний случай — групповое обсуждение, где перебивание входит в метод: запись фокус-группы с восемью участниками почти всегда содержит участки, где говорят трое. Там разбор строят иначе: не по репликам, а по темам и по тому, что прозвучало хотя бы раз.
Отдельно стоят разговоры, где важна дословность каждой фразы, — семейные объяснения, переговоры с участием юристов, разбор конфликта с подрядчиком. Наложений там не больше, чем на обычном совещании, но цена каждого выше: спорят как раз о том, кто именно и в каких словах что сказал, и перекрытая минута оказывается ровно той, ради которой запись и делалась. Для таких разговоров правило простое — важное проговаривается второй раз и в тишине, а перекрытые куски помечаются, а не пересказываются.
Созвон с задержкой: почему там перебивают даже вежливые люди
Отдельная история — онлайн-встречи, где никто никого перебивать не собирался. Дело в арифметике времени. В разговоре лицом к лицу пауза между репликами очень короткая: в исследовании десяти языков — от индонезийского до датского — самая частая величина зазора попала в диапазон 0–200 мс, и это оказалось общим свойством, а не особенностью культуры.
Теперь наложите на этот зазор канал связи. Рекомендация ITU-T по односторонней задержке называет прозрачным для разговора диапазон до 150 мс, а всё, что больше 400 мс, — неприемлемым для планирования сети. Даже задержка в пределах нормы съедает привычный зазор целиком: вы услышали паузу, начали говорить, а собеседник в этот момент уже говорил. Оба слышат наложение с опозданием, оба замолкают, оба начинают снова — знакомый двойной старт.
- Пауза в одно дыхание перед ответом. Полсекунды тишины после чужой фразы — единственный приём, который работает без договорённостей и без техники.
- Ведущий называет следующего по имени. «Марина, что по смете» снимает конкуренцию за слово: остальные не стартуют вслепую.
- Микрофон выключен, пока не взяли слово. На встрече больше пяти человек это убирает не только фон, но и половину случайных вклиниваний.
- Реакции — в чат, а не голосом. Согласие и уточнения текстом не попадают в дорожку и не рвут чужую реплику.
- Важное — под запись отдельной фразой. Решение проговаривают в тишине, а не поверх обсуждения: «фиксирую — переносим релиз на двадцать шестое».
Что сделать до разговора, чтобы перекрытий было меньше
Всё, что уменьшает наложение, делается до записи и стоит минуты. Порядок здесь важнее полноты: первые два пункта дают больше, чем остальные вместе взятые.
- Назначьте ведущего разговору, а не только повестке. Один человек раздаёт слово и возвращает его тому, кого перебили. На встрече без ведущего наложения растут вместе с накалом, и именно на самых важных минутах.
- Раздайте людям отдельные микрофоны. Когда у каждого свой микрофон, перекрытие остаётся в разговоре, но в записи голоса приходят разной громкостью — и разложить их по авторам становится реально.
- Договоритесь про важные места отдельно. Не «давайте не перебивать» вообще — это не работает, — а «на голосовании и на цифрах говорим по одному». Узкая просьба выполняется, широкая забывается к пятой минуте.
- Заведите знак вместо голоса. Поднятая рука, реакция в интерфейсе созвона, короткое сообщение в чате. Человеку нужно обозначить, что он хочет сказать, — дайте ему способ сделать это молча.
- Проговаривайте решения в тишине. Итог фразы, которая пойдёт в протокол, произносит один человек и без фона. Это же место потом ищется в записи за секунды.
- Просите называть себя, когда берёте слово впервые. После плотного спора это единственная зацепка, по которой метки в тексте раскладываются по людям.

Самый дешёвый ремонт делается в момент разговора
Это тот пункт, который экономит больше всего времени и которым почти никто не пользуется. Наложение слышно участникам в ту же секунду. Три секунды на месте закрывают вопрос, который потом стоит получаса перемотки.
Как размечать перекрытые места в тексте
Дальше работа с готовым текстом, и здесь есть одно правило, которое стоит принять раньше остальных: у перекрытого куска ровно три честных состояния. Либо вы разобрали фразу и ставите её дословно, либо слышно, что говорят двое, и это помечается, либо не разобрали вовсе — и это тоже помечается. Четвёртого варианта, в котором вы пишете правдоподобную реплику, не существует.
| Что на записи | Что писать в тексте | Чего не писать |
|---|---|---|
| Двое говорят, разобраны оба | Две реплики подряд, у обеих один таймкод | Одну склеенную реплику |
| Двое говорят, разобран один | Реплику того, кого разобрали, и пометку про второго | Догадку за второго |
| Хор из трёх и больше | «[говорят одновременно]» и суть, если она ясна | Реплики по именам наугад |
| Короткая вставка неясно чья | «[реплика с места]» с таймкодом | Приписывать её ближайшему говорящему |
| Не разобрано ничего | «[неразборчиво]» с таймкодом | Многоточие без пометки |
[говорят одновременно, 00:00] — слышно, что говорят двое, слова не разобраны. [неразборчиво, 00:00] — не разобрано ничего. [реплика с места, 00:00] — короткая вставка, автор неизвестен. [Ольга говорит поверх, 00:00] — известно, кто перекрывал. «…процентов, но не раньше» — разобран только хвост фразы; начало не дописываем. (похоже, речь о скидке) — комментарий расшифровщика: круглые скобки, свои слова. Правило 1: у каждой пометки стоит таймкод — это адрес, по которому можно переслушать. Правило 2: додуманной реплики не бывает. Либо цитата, либо пометка. Правило 3: авторство правим там, где от него зависят решения, суммы, сроки и обещания. Проверка: если пометок на час записи больше 30, менять надо запись, а не текст.
Положите легенду рядом с текстом до начала правки и держите её одинаковой во всех расшифровках: разнобой в пометках через месяц читается так же плохо, как их отсутствие.
- Ставьте таймкод у каждой пометки. Пометка без времени — это сообщение «здесь что-то было»; пометка с временем — адрес, по которому это можно переслушать.
- Пишите, кто перекрывал, если это известно. «[Ольга говорит поверх]» полезнее нейтрального «[шум]»: по этой строке потом восстанавливается ход спора.
- Не выравнивайте спорную фразу. Если из перекрытого куска разобрано «…процентов, но не раньше», так и оставляйте — с многоточием в начале. Дописанное начало через месяц читается как расшифрованное.
- Отделяйте своё толкование. Комментарий расшифровщика идёт в скобках и своими словами: «(похоже, речь о скидке)». Так его видно, и он не превращается в цитату.
- Считайте пометки. Если на часовой записи их больше тридцати, дело не в разметке, а в записи — и следующий разговор стоит организовать иначе.

Что чинится в тексте, а что не чинится
Правку перекрытых мест ведут не подряд, а точечно: перекрытий на часовой записи может быть много, а тех, от которых что-то зависит, — обычно меньше десятка. Порядок такой.
- Найдите места, где подпись говорящего идёт подряд там, где в разговоре был обмен репликами. Это и есть склейки — они собираются в глаза быстрее любых поисков.
- Проверьте метки с крохотной долей речи. Голос, у которого во всей записи три коротких реплики, чаще всего не человек, а перекрытый кусок, получивший свою подпись.
- Слушайте спорное на замедленной скорости. На 0,75 из смеси вытягиваются окончания и первое слово перебившего — то, чего на обычной скорости не разобрать.
- Переназначьте авторство там, где от него что-то зависит: решения, суммы, сроки, обещания. Остальное можно оставить как есть — в архиве это не мешает.
- Спросите по записи, если перечитывать долго. Вопрос своими словами возвращается с прямыми цитатами и отметками времени, и спорную минуту вы открываете сразу, а не ищете.
- Что не восстановилось — пометьте и переспросите участников. Одна строка в письме дешевле часа попыток вытянуть фразу из смеси.
На пределе документ пишется по-другому, и это стоит освоить один раз. Вместо диалога — список того, что прозвучало: варианты, возражения, итог. Вместо имени у спорной фразы — роль или прямая пометка о том, что автор неизвестен. Вместо цитаты на хоре — её содержание своими словами и таймкод, по которому любой может послушать сам и не поверить вам на слово. Такой документ короче и выглядит скромнее дословной стенограммы, зато в нём нет ни одной строки, которую придётся отзывать.

- В разговоре«повторите, вас перебили»
- В текстепометка вместо догадки
- По таймкодупереслушать спорное
- В документрешения, а не хор
И последнее, что стоит держать в голове при разборе. Ошибка в словах бросается в глаза, ошибка в авторстве — нет: текст читается гладко, просто цитата приписана не тому. Поэтому качество расшифровки на записи со спорами оценивают не по опечаткам, а по одному вопросу — правильно ли подписаны те пять-шесть фраз, которые вы понесёте дальше.
Спорят, перебивают, говорят хором
Загрузите запись: Vibe2Text разложит разговор по говорящим и проставит время у каждой реплики, а имена подставит из самого разговора. Спорные места вы правите по таймкодам — клик по строке проигрывает именно этот фрагмент.
Разделить говорящих в записиБесплатный старт без карты, файлы до 4 ГБ и до 6 часов, русский и английский. Выгрузка: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.
Частые вопросы
Что делать, если на записи все перебивают друг друга?
Разбирайте не всю запись, а те места, от которых что-то зависит. Сначала найдите склейки — участки, где одна и та же подпись идёт подряд там, где был обмен репликами, — и переназначьте авторство по таймкодам. Перекрытые куски, из которых ничего не вытягивается, пометьте «[говорят одновременно]» и не додумывайте. Если спорная фраза важна, переспросите участников в тот же день: письмо на две строки надёжнее любой обработки звука.
Как распознать речь, когда говорят вместе?
Слова на перекрытом участке распознаются тем хуже, чем ближе голоса по громкости: микрофон пишет их сумму, и разделить её обратно по одной дорожке нельзя. Практически помогают три вещи: отдельный микрофон каждому — тогда голоса приходят с разной громкостью; прослушивание спорного места на скорости 0,75, где вытягиваются окончания и первое слово перебившего; и повтор фразы в разговоре, если наложение заметили сразу.
Почему в записи появился лишний говорящий, хотя людей было четверо?
Смесь двух голосов звучит как третий, незнакомый, и получает собственную метку. Такие метки узнаются по объёму: во всей записи у них две-три коротких реплики. Их удаляют или объединяют с настоящим говорящим в редакторе — это правка на несколько секунд.
Почему на созвоне перебивания случаются чаще, чем в переговорной?
Из-за задержки. Привычная пауза между репликами в живом разговоре укладывается в 0,2 секунды — это общее свойство разговора, показанное на выборке из десяти языков. Задержка канала часто сопоставима с этим зазором или больше него, поэтому собеседники стартуют вслепую: оба услышали паузу, оба начали говорить. Лечится не техникой, а привычкой выдерживать полсекунды перед ответом и практикой ведущего называть следующего по имени.
Почему пометка «[говорят одновременно]» лучше, чем восстановленная реплика?
Потому что через месяц отличить восстановленное от расшифрованного будет нечем. Пометка сохраняет разницу между тем, что прозвучало, и тем, что показалось правдоподобным, — и указывает адрес, по которому это можно переслушать. В спорной ситуации выдуманная реплика обесценивает весь документ, а честная пометка не обесценивает ничего.
Наложение голосов в записи можно убрать обработкой звука?
Разложить сумму двух голосов обратно на два по одной дорожке нельзя: в файле их сумма, а не два сигнала рядом. Бытовая чистка шумодавом на таком участке только ухудшает результат — она подрезает окончания слов вместе с фоном. Работает другое: отдельные микрофоны на будущих записях и точечная правка авторства в готовом тексте.
Сколько времени занимает разбор записи, где много перекрытий?
Считайте по спорным местам, а не по длине записи. На часовом разговоре четверых обычно набирается от 5 до 15 участков, где авторство важно; каждый проверяется прослушиванием и правится за 1–2 минуты, то есть на всё уходит около получаса. Час плотного спора шестерых на одном микрофоне занимает дольше — там разумнее размечать по ролям и вынимать решения списком, а не восстанавливать диалог построчно.
Проверено 15 августа 2026 года. Доли перекрытой речи (54,4 % кусков и 17,0 % слов на живых обсуждениях, 31,4 % и 8,8 % на совещаниях с одним ведущим, 53,0–54,4 % и 11,7–12,0 % в телефонных разговорах двоих), определение куска речи как участка без пауз длиннее 500 мс, доля ошибочно распознанных слов (41,3 % на чистых участках против 53,4 % на перекрытых; 38,7 % против 70,4 % на петличном микрофоне), распределение вклиниваний (72,9 % на границах кусков, около 27 % внутри непрерывной речи), а также наблюдение, что перебивания приходятся на поддакивания, вводные слова и запинки, — по работе E. Shriberg, A. Stolcke, D. Baron «Observations on Overlap: Findings and Implications for Automatic Processing of Multi-Party Conversation» (Eurospeech 2001), таблицы 2 и 3. Доля наложений среди переходов между говорящими (40,0 % в корпусе разговорного нидерландского, 41,7 % и 40,0 % в двух корпусах Map Task) и длительность наложения (медиана 470 мс, среднее 610 мс) — по работе M. Heldner, J. Edlund «Pauses, gaps and overlaps in conversations» (Journal of Phonetics, 2010), таблицы 4 и 5. Величина паузы между репликами в разговоре и её устойчивость в разных языках — по статье T. Stivers и соавторов «Universals and cultural variation in turn-taking in conversation» (PNAS, 2009, doi:10.1073/pnas.0903616106). Границы односторонней задержки для разговорной связи — по Рекомендации ITU-T G.114 «One-way transmission time». Учёт перекрывающейся речи при оценке разметки говорящих без допуска на границах — по планам оценки открытого испытания DIHARD.