Точность транскрипции и аналитика: как ошибки искажают результаты
Ошибки транскрипции не видны в отчёте: число убедительно, просто опирается на неверные разговоры. В статье — связь точности транскрипции и аналитики: пять типов ошибок, роль качества звука, какая ошибка искажает какой результат и ежемесячный порядок проверки.
Короткий ответ
Аналитика звонков опирается на транскрипт, а транскрипт — речь, превращённая в текст, — всегда содержит ошибки. Самые опасные для аналитики: искажённые отраслевые термины и названия продуктов, неверно расслышанные числа (цена, дата, количество), потерянное отрицание («можно» вместо «нельзя»), сбой при переключении языков и путаница говорящих. Каждая искажает свой результат: спрос на продукт, возражения по цене, намерение, карту возражений.
Проблема в том, что ошибки транскрипции в отчёте не видны. Число выглядит убедительно, просто опирается на неверные разговоры. Поэтому каждая команда, использующая аналитику звонков, должна проверять качество транскрипции на своём языке и в своей сфере.
Почему общего показателя точности мало
Системы распознавания речи обычно оценивают по общей доле ошибок: сколько слов распознано неверно. Но для аналитики слова не равноценны. Ошибки в словах «и», «это», «хорошо» ни на что не влияют. Ошибка в названии продукта, цене или отрицании меняет целое поле. Общий показатель может быть хорошим, а те 5% слов, что важны для вас, — именно самыми часто искажаемыми.
Тип ошибки 1: термины и названия
Названия продуктов, моделей, услуг и брендов — особенно иностранные и аббревиатуры — распознаются хуже всего. Итог: значения поля «интересующий продукт» делятся неверно, спрос на один продукт записывается другому или попадает в «другое». Проверка: найдите в транскриптах названия 10 самых продаваемых продуктов и сверьте с реальными звонками.
Тип ошибки 2: числа
Цены, даты, размеры и количества в речи часто путаются: «пятнадцать» и «пятьдесят», «тринадцать» и «тридцать». Итог: поля вроде диапазона бюджета, суммы в возражении по цене или даты доставки заполняются неверно. Проверяйте поля на основе чисел отдельно и по возможности берите число из системы (заказ, CRM), а не из разговора.
Тип ошибки 3: отрицание
В азербайджанском отрицание часто — маленький суффикс в конце глагола: разница между «возьму» и «не возьму» может быть в одном слоге. В шумном звонке она легко теряется. Итог: поле намерения может перевернуться полностью — отказ читается как согласие. Результаты, связанные с отрицанием, в полях намерения и исхода проверяйте особо.
Тип ошибки 4: переключение языков
Клиенты смешивают в одной фразе азербайджанские, русские и английские слова. Если система распознавания настроена на один язык, слова другого она пишет с ошибками или пропускает. Итог: возражение или название продукта, сказанное по-русски, превращается в транскрипте в непонятное слово. Знайте долю звонков со смешением языков и проверяйте их отдельно.
Тип ошибки 5: путаница говорящих
Если реплика оператора в транскрипте приписана клиенту, аналитика считает слова оператора мнением клиента: фраза из скрипта «гарантия 2 года» выглядит как интерес клиента к гарантии. Это особенно часто бывает в моно-записях. Подробнее: диаризация звонков.
Роль качества звука
- Мобильная сеть, шумная обстановка, громкая связь — повышают долю ошибок.
- Стерео-запись (каждая сторона в своём канале) сильно упрощает разделение говорящих.
- На очень плохих записях распознавание ненадёжно — честнее исключать или помечать их отдельно.
- Если система распознавания даёт показатель уверенности по каждой строке, помечайте строки с низкой уверенностью.
Какая ошибка искажает какой результат
- Спрос на продуктОшибки в терминах и названиях.
- Возражения по цене и бюджетОшибки в числах.
- Намерение и исходОшибки в отрицании.
- Карта возраженийПутаница говорящих — слова оператора читаются как возражение клиента.
- Сравнение каналов и сегментовКачество звука — один канал (например, мобильные звонки) систематически распознаётся хуже.
Как составить отраслевой словарь
Самый практичный способ сократить ошибки в терминах — отраслевой словарь: список названий продуктов, моделей, услуг и конкурентов, а также специфичных слов, и рядом с каждым — частые ошибочные написания в транскриптах. Словарь используется в двух местах: если система распознавания позволяет, он передаётся ей как подсказки; а ошибочные написания добавляются в примеры полей аналитики, чтобы AI связывал их с верным значением. Обновляйте словарь вместе со списком продуктов: вышла новая модель — её название тоже должно попасть в словарь.
Порядок проверки
- Выборка20–30 звонков в месяц: разные каналы, часы, операторы, смешение языков.
- ПрослушиваниеКлючевые моменты каждого звонка (название, число, отрицание, возражение) сверяются со звуком.
- ЗаписьКакой тип ошибки и на какое поле повлиял.
- ДействиеСловарь отраслевых терминов, пометка плохих записей, числа из системы.
Иллюстративный пример
Это иллюстративный пример. Автосервис видит в аналитике звонков резкое падение обращений о «тормозных дисках». Проверка показывает, что обращений меньше не стало: после перехода на новую телефонную линию ухудшился звук, термин транскрибируется в разных неверных формах, и AI относит его в «другое».
Звук исправляют, самые частые ошибочные написания добавляют в примеры поля, звонки за две последние недели анализируют заново. «Падение спроса» на деле было ошибкой измерения.
Типичные ошибки
- Переносить общий показатель точности вендора на свой язык и сферу.
- Никогда не сравнивать транскрипт со звуком.
- Считать резкое падение значения реальным изменением без проверки.
- Учитывать плохие по качеству звонки наравне с хорошими.
Границы
- Транскрипт не передаёт тон голоса, интонацию и паузы — текст показывает только слова.
- Доля ошибок зависит от языка, акцента, качества звука и сферы; одна проверка всего не охватывает.
- Серьёзные решения о сотруднике нельзя принимать по транскрипту без проверки записи.
Надёжность транскриптов в Vexvon
Аналитика разговоров Vexvon работает с текстом, хранящимся в разговорах, и рядом с каждым результатом показывает собственную фразу клиента как доказательство — это упрощает поиск ошибок транскрипции, потому что подозрительный результат можно сразу прочитать. Часто повторяющиеся фразы из «другого» видны отдельно: неверно распознанный термин часто всплывает именно там. Сама транскрипция записанных звонков, разделение говорящих и пометка строк с низкой уверенностью — задача инструмента анализа звонков. Подробнее: аналитика.
Следующий шаг
В этом месяце прослушайте 20 звонков и проверьте, как в транскриптах записаны названия продуктов, числа и отрицания. Список самых часто искажаемых слов — ваш первый план исправлений. Как проверять категории AI — в статье проверка AI-категоризации; проверку можно настроить вместе на демо.
Продолжение темы: статус «неизвестно» в аналитике, таксономия аналитики разговоров.
- Данные, таксономия и надёжность5 мин чтенияИнтеграция аналитики разговоров с CRM: как связать данные звонков и чатов
- Данные, таксономия и надёжность5 мин чтенияТаксономия аналитики разговоров: как построить правильную систему категорий
- Данные, таксономия и надёжность5 мин чтенияКонфиденциальность в аналитике разговоров: как защитить данные клиентов