Skip to main content
Данные, таксономия и надёжность

Точность транскрипции и аналитика: как ошибки искажают результаты

Ошибки транскрипции не видны в отчёте: число убедительно, просто опирается на неверные разговоры. В статье — связь точности транскрипции и аналитики: пять типов ошибок, роль качества звука, какая ошибка искажает какой результат и ежемесячный порядок проверки.

5 октября 20265 мин чтения

Короткий ответ

Аналитика звонков опирается на транскрипт, а транскрипт — речь, превращённая в текст, — всегда содержит ошибки. Самые опасные для аналитики: искажённые отраслевые термины и названия продуктов, неверно расслышанные числа (цена, дата, количество), потерянное отрицание («можно» вместо «нельзя»), сбой при переключении языков и путаница говорящих. Каждая искажает свой результат: спрос на продукт, возражения по цене, намерение, карту возражений.

Проблема в том, что ошибки транскрипции в отчёте не видны. Число выглядит убедительно, просто опирается на неверные разговоры. Поэтому каждая команда, использующая аналитику звонков, должна проверять качество транскрипции на своём языке и в своей сфере.

Почему общего показателя точности мало

Системы распознавания речи обычно оценивают по общей доле ошибок: сколько слов распознано неверно. Но для аналитики слова не равноценны. Ошибки в словах «и», «это», «хорошо» ни на что не влияют. Ошибка в названии продукта, цене или отрицании меняет целое поле. Общий показатель может быть хорошим, а те 5% слов, что важны для вас, — именно самыми часто искажаемыми.

Тип ошибки 1: термины и названия

Названия продуктов, моделей, услуг и брендов — особенно иностранные и аббревиатуры — распознаются хуже всего. Итог: значения поля «интересующий продукт» делятся неверно, спрос на один продукт записывается другому или попадает в «другое». Проверка: найдите в транскриптах названия 10 самых продаваемых продуктов и сверьте с реальными звонками.

Тип ошибки 2: числа

Цены, даты, размеры и количества в речи часто путаются: «пятнадцать» и «пятьдесят», «тринадцать» и «тридцать». Итог: поля вроде диапазона бюджета, суммы в возражении по цене или даты доставки заполняются неверно. Проверяйте поля на основе чисел отдельно и по возможности берите число из системы (заказ, CRM), а не из разговора.

Тип ошибки 3: отрицание

В азербайджанском отрицание часто — маленький суффикс в конце глагола: разница между «возьму» и «не возьму» может быть в одном слоге. В шумном звонке она легко теряется. Итог: поле намерения может перевернуться полностью — отказ читается как согласие. Результаты, связанные с отрицанием, в полях намерения и исхода проверяйте особо.

Тип ошибки 4: переключение языков

Клиенты смешивают в одной фразе азербайджанские, русские и английские слова. Если система распознавания настроена на один язык, слова другого она пишет с ошибками или пропускает. Итог: возражение или название продукта, сказанное по-русски, превращается в транскрипте в непонятное слово. Знайте долю звонков со смешением языков и проверяйте их отдельно.

Тип ошибки 5: путаница говорящих

Если реплика оператора в транскрипте приписана клиенту, аналитика считает слова оператора мнением клиента: фраза из скрипта «гарантия 2 года» выглядит как интерес клиента к гарантии. Это особенно часто бывает в моно-записях. Подробнее: диаризация звонков.

Роль качества звука

  • Мобильная сеть, шумная обстановка, громкая связь — повышают долю ошибок.
  • Стерео-запись (каждая сторона в своём канале) сильно упрощает разделение говорящих.
  • На очень плохих записях распознавание ненадёжно — честнее исключать или помечать их отдельно.
  • Если система распознавания даёт показатель уверенности по каждой строке, помечайте строки с низкой уверенностью.

Какая ошибка искажает какой результат

  1. Спрос на продуктОшибки в терминах и названиях.
  2. Возражения по цене и бюджетОшибки в числах.
  3. Намерение и исходОшибки в отрицании.
  4. Карта возраженийПутаница говорящих — слова оператора читаются как возражение клиента.
  5. Сравнение каналов и сегментовКачество звука — один канал (например, мобильные звонки) систематически распознаётся хуже.

Как составить отраслевой словарь

Самый практичный способ сократить ошибки в терминах — отраслевой словарь: список названий продуктов, моделей, услуг и конкурентов, а также специфичных слов, и рядом с каждым — частые ошибочные написания в транскриптах. Словарь используется в двух местах: если система распознавания позволяет, он передаётся ей как подсказки; а ошибочные написания добавляются в примеры полей аналитики, чтобы AI связывал их с верным значением. Обновляйте словарь вместе со списком продуктов: вышла новая модель — её название тоже должно попасть в словарь.

Порядок проверки

  1. Выборка20–30 звонков в месяц: разные каналы, часы, операторы, смешение языков.
  2. ПрослушиваниеКлючевые моменты каждого звонка (название, число, отрицание, возражение) сверяются со звуком.
  3. ЗаписьКакой тип ошибки и на какое поле повлиял.
  4. ДействиеСловарь отраслевых терминов, пометка плохих записей, числа из системы.

Иллюстративный пример

Это иллюстративный пример. Автосервис видит в аналитике звонков резкое падение обращений о «тормозных дисках». Проверка показывает, что обращений меньше не стало: после перехода на новую телефонную линию ухудшился звук, термин транскрибируется в разных неверных формах, и AI относит его в «другое».

Звук исправляют, самые частые ошибочные написания добавляют в примеры поля, звонки за две последние недели анализируют заново. «Падение спроса» на деле было ошибкой измерения.

Типичные ошибки

  • Переносить общий показатель точности вендора на свой язык и сферу.
  • Никогда не сравнивать транскрипт со звуком.
  • Считать резкое падение значения реальным изменением без проверки.
  • Учитывать плохие по качеству звонки наравне с хорошими.

Границы

  • Транскрипт не передаёт тон голоса, интонацию и паузы — текст показывает только слова.
  • Доля ошибок зависит от языка, акцента, качества звука и сферы; одна проверка всего не охватывает.
  • Серьёзные решения о сотруднике нельзя принимать по транскрипту без проверки записи.

Надёжность транскриптов в Vexvon

Аналитика разговоров Vexvon работает с текстом, хранящимся в разговорах, и рядом с каждым результатом показывает собственную фразу клиента как доказательство — это упрощает поиск ошибок транскрипции, потому что подозрительный результат можно сразу прочитать. Часто повторяющиеся фразы из «другого» видны отдельно: неверно распознанный термин часто всплывает именно там. Сама транскрипция записанных звонков, разделение говорящих и пометка строк с низкой уверенностью — задача инструмента анализа звонков. Подробнее: аналитика.

Следующий шаг

В этом месяце прослушайте 20 звонков и проверьте, как в транскриптах записаны названия продуктов, числа и отрицания. Список самых часто искажаемых слов — ваш первый план исправлений. Как проверять категории AI — в статье проверка AI-категоризации; проверку можно настроить вместе на демо.

Продолжение темы: статус «неизвестно» в аналитике, таксономия аналитики разговоров.

Live demo

Ready? Let's start

See Vexvon live in a 10-minute demo.

  • A scenario built for your business
  • A live sample call
  • A tour of the platform
Get a demoorBook a meeting

Your details are used only for the demo and to get in touch.