
РАЗБОР
Что такое речевая аналитика: три слоя между записью звонка и отчётом
Купили речевую аналитику — получили дашборд с тональностью, а решения в отделе остались прежними. Разбираем по слоям: что здесь считает арифметика, что оценивается на глазок и при каком объёме разговоров всё это имеет смысл.
Речевая аналитика — это счётчики поверх текста разговора
Отдел подключил платформу, и раз в неделю руководителю приходит письмо: средняя тональность 62 %, индекс вовлечённости вырос на четыре пункта, топ-5 тем обращений. Прочитать это интересно ровно один раз, потому что непонятно, что делать с этим в понедельник утром. Вопрос «что такое речевая аналитика» обычно и возникает в этот момент — уже после покупки, и звучит он не «как называется технология», а «откуда берутся эти цифры и какой из них верить».
Путаница начинается с того, что «речевой аналитикой» называют и всю конструкцию целиком, и любой отдельный её слой. Компания платит за три, смотрит на один, а когда цифры расходятся со здравым смыслом, спорить оказывается не о чем: непонятно, на каком этаже возникла ошибка. Дальше — по слоям, снизу вверх.
Слой первый: пока нет текста, считать нечего
Все метрики в конечном счёте вычисляются по строчкам расшифровки, а не по звуковой волне. Поэтому нижний этаж — это перевод записи в текст: слова, время каждой реплики и метка говорящего рядом с ней. Ровно эти три вещи и есть сырьё для всего остального.
Метка говорящего важнее, чем кажется на первый взгляд. Без неё нельзя посчитать ни долю речи, ни длину монолога, ни кто задал вопрос, а кто на него ответил. Задача эта отдельная от распознавания слов и ошибается по-своему: разделение спикеров способно слить двух похожих собеседников в одну метку или расщепить одного человека на двух, а почему так выходит — разговор на отдельную статью.

Слой второй: что на самом деле считают по тексту
Здесь и находится собственно аналитика. У разных платформ набор показателей называется по-разному, но по существу делится на три группы: время, слова и структура разговора. Ниже — что стоит за каждым числом и насколько ему стоит верить.
| Метрика | Из чего берётся | Насколько ей верить |
|---|---|---|
| Доля речи каждой стороны | суммарная длительность реплик по меткам говорящих | высоко: арифметика по разметке |
| Самый длинный монолог | непрерывный отрезок речи одной стороны | высоко, если разметка не сбоила |
| Паузы и молчание | промежутки между репликами | средне: причину паузы число не знает |
| Перебивания | наложение реплик двух сторон | средне: поддакивание считается перебиванием |
| Темп речи | число слов, делённое на время | высоко как число, но смысл появляется только в сравнении |
| Слова-маркеры | поиск по тексту: «дорого», имя конкурента, обещание скидки | зависит от того, ищут формулировку или смысл |
| Соблюдение этапов | признак этапа найден в нужном месте разговора | зависит от того, как описан признак |
| Тональность | оценка эмоции по словам и голосу | низко, и об этом отдельно ниже |
Метрики времени: их считает разметка, а не смысл
Доли речи, монологи и паузы — самые твёрдые числа во всём наборе, потому что это чистая арифметика поверх меток говорящих. Из-за этой твёрдости их и переоценивают: то, что менеджер занял 70 % разговора, — факт; то, что из-за этого сделка не пошла, — гипотеза, которую надо проверять отдельно и на массиве.
Отдельная ловушка — молчание. Тридцать секунд тишины посреди звонка означают и «оператор ищет данные в системе», и «клиент читает договор», и неловкую паузу после названной цены. В таблице это одна и та же строка; различить три ситуации можно, только открыв текст на этом таймкоде и послушав.
Метрики слов: маркеры, темы и этапы разговора
Второй куст — про то, что прозвучало. Самый простой вариант: список слов-маркеров и подсчёт, в скольких разговорах они встретились. «Дорого», «мы подумаем», «пришлите на почту», название конкурента, обещание скидки, упоминание сроков поставки. Это дёшево, считается мгновенно и уже даёт срез: в каком проценте звонков всплывает цена, а в каком — сроки.
Слабость подхода в том, что живая речь редко совпадает со списком. Клиент не говорит «это дорого» — он говорит «ну, бюджет у нас пока другой». Поиск по точной формулировке этого не увидит, поиск по смыслу — увидит, и разница между двумя способами больше, чем разница между платформами. Из тех же признаков собирается и проверка сценария разговора: как переписать пункты скрипта так, чтобы их вообще можно было засчитать, разобрано в статье про контроль соблюдения скрипта продаж.

Тональность: метрика, которой верят больше, чем следует
«Средняя тональность выросла на 6 %» — фраза, которая в отчёте выглядит убедительнее всех остальных и означает меньше всех остальных. Дело не в том, что алгоритм плохой. Дело в том, что у самой величины нет твёрдого эталона, с которым её можно было бы сверить.
Видно это по тому, как эмоции размечают люди в открытых исследовательских наборах. В наборе MELD три размётчика оценивали одни и те же реплики диалогов, видя и слыша сцену целиком, — согласие между ними составило 0,43 по каппе Флейсса. Когда те же реплики размечали только по тексту, без голоса, согласие падало до 0,34. Проще говоря, люди, слушая одну и ту же фразу, расходятся в оценке её эмоции очень часто, и алгоритм, обученный на таких метках, точнее самих меток быть не может.
Практический вывод не «выключить тональность», а «не принимать по ней решений». Как фильтр для отбора записей на прослушивание она годится: «покажи разговоры с самым резким финалом» — рабочий запрос. Как показатель качества работы отдела за неделю средняя тональность не годится совсем: она сдвигается от смены тематики обращений быстрее, чем от чего-либо, на что вы способны повлиять.
Слой третий: отчёты и выборки — то, ради чего всё считалось
Метрики сами по себе бесполезны: колонка чисел по тремстам разговорам — это таблица, а не аналитика. Верхний слой превращает её в три типа ответов, и именно за них платят.
- Срез по массиву. «В 38 % разговоров цена прозвучала после третьей минуты», «у половины звонков в финале нет даты». Само число ничего не значит — смысл появляется в сравнении с прошлым месяцем или между группами.
- Выборка на разбор. Список конкретных записей, отобранных по условию: длинный монолог, упоминание конкурента, обрыв в первую минуту. Дальше это уже не аналитика, а обычное прослушивание — но пяти нужных записей, а не пяти случайных.
- Ответ по конкретной записи. «Что клиент сказал про сроки» — на это отвечает не сводная таблица, а текст разговора с цитатой и отметкой времени.

В Vibe2Text верхний слой выглядит так: поверх расшифровки собирается отчёт по записи — резюме или свой шаблон с вашими формулировками, — а по архиву работает поиск, который находит нужный разговор по содержанию, а не по имени файла. Для команд, где записей много и они разные, есть отдельный разбор сценариев: расшифровка для бизнеса.
- Записьзвонок или встреча
- Текстреплики, спикеры, таймкоды
- Метрикидоли, паузы, слова, этапы
- Решениесрез, выборка, разбор
Чем аналитика отличается от расшифровки и от прослушивания выборки
Три инструмента путают постоянно, а спор «нужна аналитика или хватит расшифровки» решается одним вопросом: на что вы хотите ответить.
| Прослушать выборку | Расшифровать всё | Речевая аналитика | |
|---|---|---|---|
| Охват | несколько записей в неделю | весь массив | весь массив |
| Отвечает на вопрос | как это звучало | что было сказано дословно | как признаки распределены по массиву |
| На выходе | заметки руководителя | текст со спикерами и таймкодами | проценты, срезы и списки записей |
| Чего не даёт | картины по отделу | сравнения между людьми и периодами | объяснения причины |
| Хватает, когда | разбираете один разговор | нужен точный текст и поиск по нему | разговоров сотни в неделю |
Из таблицы следует неочевидное: аналитика не заменяет прослушивание, а меняет способ выбора того, что слушать. Число «у Петрова доля речи 74 %» не объясняет ничего — объяснение находится внутри конкретного разговора, и открыть его всё равно придётся. Как отбирать записи, когда их пятьсот в неделю, разобрано отдельно: как выбрать пять звонков из пятисот.
Верно и обратное. Расшифровка без метрик закрывает больше задач, чем принято думать: поиск по архиву, точная цитата, восстановление договорённости, документ по итогам разговора. Многим командам нужно именно это, а слово «аналитика» всплывает только потому, что так называется соседняя строчка в прайсе.
Где речевая аналитика окупается
Общее условие одно, и состоит оно из трёх частей. Как только отваливается любая, ценность падает быстро — а продают платформу одинаково всем.
- Колл-центр. Сотни однотипных обращений в день, у оператора есть регламент, а у руководителя — вопрос «что чаще всего ломается». Здесь срез по темам обращений окупается сам по себе: он показывает, какую страницу справки надо переписать, чтобы звонков стало меньше.
- Отдел продаж. Есть сценарий разговора и есть результат сделки, а значит, признаки можно сопоставить с исходом. Это единственная связка, ради которой стоит городить метрики: без исхода процент соблюдения ничего не измеряет.
- Поддержка и клиентский опыт. Не оценка операторов, а поиск повторяющихся формулировок: на чём именно люди спотыкаются в интерфейсе, какое слово в счёте вызывает вопросы. Такие вещи выпадают из опросов и живут только в разговорах.
- Исследования и интервью. Двадцать глубинных интервью — уже массив, в котором руками не удержать, кто что сказал. Ценны здесь не проценты, а сведение похожих высказываний в одно место со ссылками на источник.
В первых двух случаях речь идёт о потоке записей, и главный вопрос обычно не в метриках, а в том, откуда файлы берутся и куда складываются: маршрут записи и сроки хранения разобраны в статье про запись звонков в колл-центре. Готовые сценарии под поток — расшифровка для колл-центров и расшифровка звонков в продажах.
Пять случаев, когда анализ звонков переоценён
Ситуации, в которых деньги на метрики уходят, а решения остаются прежними. Первая встречается чаще остальных вместе взятых.
- Разговоров слишком мало. При сотне звонков на менеджера в месяц разница в конверсии 12 % против 18 % статистически неотличима от случайности: доверительные диапазоны двух оценок перекрываются. Проценты на таком объёме создают ощущение точности, которого нет.
- Разговоры без сценария. Экспертная продажа, консультация врача, переговоры о партнёрстве — там, где каждый разговор идёт своим маршрутом, считать «соблюдение этапов» не по чему. Метрики времени работают и здесь, а вот структурные превращаются в измерение того, насколько разговор похож на воображаемый эталон.
- Тональность как показатель качества. Разобрано выше: величина без эталона. Годится для сортировки записей, не годится для выводов и тем более для сравнения людей.
- Отчёт, который никто не открывает. Самая дорогая ошибка. Если у цифры нет владельца и заранее описанного действия — «если доля разговоров без даты выше 30 %, на этой неделе разбираем именно это», — она превращается в еженедельное письмо, которое перестают читать на третий месяц.
- Ожидание, что платформа найдёт причину. Аналитика показывает, где расходятся числа. Почему они расходятся, выясняется прослушиванием записей и разговором с людьми — этот шаг не автоматизируется.
Как проверить пользу до покупки платформы
Нижние два слоя проверяются за неделю и почти без затрат: нужны расшифровка всех разговоров за период и полтора часа вашего времени.
- Расшифруйте всё за одну неделю. Не выборку, а весь поток: mp3 из телефонии, записи встреч, файлы с диктофона. Полнота — то, чем аналитика отличается от выборочного контроля.
- Сформулируйте ровно три вопроса. Не «посмотрим, что интересного», а конкретно: в скольких разговорах в финале названа дата; в скольких звучало слово о цене раньше третьей минуты; в скольких упоминался конкурент. Три вопроса, на которые есть однозначный ответ «да» или «нет» по каждой записи.
- Ответьте на них по текстам. Поиском по архиву и вопросами по записи — руками это тридцать-сорок разговоров за час. Если ответ не получается, метрика сформулирована плохо и на платформе сломается так же.
- Посчитайте доли и сравните с ожиданием. Важна не цифра, а разрыв с вашим представлением. Если вы угадали все три — измерять пока нечего, вы и так знаете, что происходит.
- Выберите одно изменение и повторите через месяц. Одно, а не пять: иначе через месяц не понять, что подействовало.
- Только после этого считайте деньги. К этому моменту у вас есть три работающих вопроса и понимание, сколько времени уходит на ответ вручную, — разговор с поставщиком становится предметным.

Что спросить у поставщика речевой аналитики
Демонстрация всегда показывает верхний слой. Вопросы, которые возвращают разговор к нижним двум и заодно проверяют, кто перед вами.
- Покажите расшифровку нашей записи, а не вашей. Дайте типичный файл — с телефонным звуком, перебиваниями и жаргоном. Что неверно в тексте, будет неверно и в метриках.
- Как считается доля речи, если говорящих перепутали? Ответ «такого не бывает» означает, что про первый слой в компании не думали.
- Метрика ищет формулировку или смысл? Поиск по списку фраз и поиск по смыслу дают на живых разговорах разные числа, и разница здесь принципиальнее, чем в интерфейсе.
- Можно ли перепроверить любое число вручную? От процента в отчёте должен быть путь до списка конкретных записей и до реплики внутри записи. Без этого спорить о цифре бессмысленно, а спорить будут.
- Что происходит с тональностью на нашем материале? Попросите показать пять записей с самой негативной оценкой и послушайте их. Половину этой пятёрки вы, скорее всего, оцените иначе.
- Куда уезжают записи и на какой срок. Разговоры клиентов — персональные данные, и хранение обсуждают до подключения, а не после.
И вопрос, который к поставщику отношения не имеет, — про людей. Метрики по разговорам меняют поведение сотрудников быстрее, чем дают руководителю новую информацию: как только становится известно, по каким признакам считают, разговоры подстраиваются под признаки. Это не повод отказываться от измерений, но повод обсудить их с командой открыто.
Начните с текста, а не с дашборда
Загрузите записи разговоров: Vibe2Text вернёт текст с разделением сторон и таймкодами, отчёт по каждой записи и поиск по всему архиву. Этого достаточно, чтобы посчитать первые метрики руками и понять, нужна ли вам платформа.
Расшифровать записи разговоровБесплатный старт без карты, файлы до 4 ГБ и до 6 часов. Экспорт: DOCX, PDF, TXT, Markdown, JSON, SRT, VTT.
Частые вопросы
Что такое речевая аналитика простыми словами?
Это автоматический подсчёт признаков по текстам разговоров. Сначала запись переводится в текст с указанием, кто и когда говорил, затем по тексту считаются доли речи сторон, длина монологов, паузы и наличие нужных слов, а из этих величин собираются отчёты и списки записей на разбор. Сама по себе она ничего не решает — она сокращает путь от «у нас триста разговоров» до «вот эти пять стоит послушать».
Чем речевая аналитика отличается от транскрибации?
Транскрибация отвечает на вопрос «что было сказано» в конкретной записи и заканчивается текстом. Аналитика начинается там, где текст уже есть, и отвечает на вопрос «как признаки распределены по всему массиву». Без первого второе технически невозможно, а вот первое без второго прекрасно живёт и закрывает большинство задач: поиск по архиву, точная цитата, документ по итогам разговора.
Нужна ли speech analytics для колл-центра на десять операторов?
Скорее нет, если сравнивать между собой операторов: на человека приходится слишком мало разговоров, чтобы различия в процентах отличались от случайного разброса. А вот срез по темам обращений на всём потоке полезен при любом размере — он показывает, что чаще всего спрашивают, и это уже повод переписать инструкцию или страницу справки.
Можно ли анализировать звонки автоматически без отдельной платформы?
Первые три-пять метрик считаются по расшифровкам без специального инструмента. Нужны полный охват — расшифрованы все разговоры, а не выборка, — и вопросы, на которые по каждой записи есть однозначный ответ. Тридцать-сорок разговоров разбираются за час поиском по архиву. Автоматизировать имеет смысл после того, как стало ясно, какие вопросы вы задаёте каждую неделю.
Насколько точна оценка тональности разговора?
Настолько, насколько люди вообще согласны между собой в оценке эмоций. В открытых исследовательских наборах трое размётчиков, слушая одни и те же реплики, сходятся во мнении заметно реже, чем в задачах вроде распознавания слов, — и алгоритм, обученный на таких метках, не может быть надёжнее их. Практический вывод: тональность годится как фильтр для отбора записей на прослушивание и не годится как показатель, по которому сравнивают сотрудников или недели.
Какие метрики речевой аналитики стоит считать в первую очередь?
Те, что считаются по разметке и проверяются вручную: доля речи каждой стороны, самый длинный монолог, наличие даты следующего шага в финале и упоминание оговорённого списка слов. Каждую из этих четырёх можно перепроверить на любой записи и получить тот же ответ. Тональность, «индекс вовлечённости» и прочие сводные баллы оставьте на потом.
Проверено 15 августа 2026. Согласие размётчиков при оценке эмоций — по статье «MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations» (ACL 2019): каппа Флейсса 0,43 при разметке с видео и звуком против 0,34 при разметке только по тексту; сопоставимый разброс той же величины на других открытых наборах — по работе «Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models» (arXiv, январь 2026). Состав функций речевой аналитики — распознавание речи, поиск ключевых слов, категоризация тем, оценка тональности, анализ молчания — и заявленный охват «100 % обращений против выборочного контроля качества» сверены по открытым глоссариям поставщиков (NiCE, раздел Speech Analytics; Observe.AI, Contact Center Glossary). Порог различимости долей — стандартное сравнение двух долей: при сотне разговоров на человека разница около десяти процентных пунктов и меньше не отличается от случайной.