Skip to main content
Аудиоанализ

Точность анализа звонков: как измерять AI-оценку

Фраза «наша система точна на 90%» бесполезна, если не сказано, что измеряли, на каких звонках и на каком языке. В статье точность AI-анализа звонков разложена на четыре отдельные меры, на иллюстративном расчёте показано, как 89% согласия могут скрывать пропуск четверти реальных нарушений, а также разобраны построение эталонного набора, почему показатель уверенности — не вероятность, анализ причин расхождений, отчёт о точности на одной странице и постоянный контроль.

29 сентября 20266 мин чтения

Короткий ответ

Точность AI-анализа звонков не измеряется одним числом. Отдельно нужно измерять как минимум четыре вещи: качество транскрипта, согласие AI с эталоном людей по каждому критерию, тип ошибок на критических критериях — ложные флаги и пропущенные нарушения — и долю звонков, которые нельзя проанализировать. Фраза «наша система точна на 90%» бесполезна, если не сказано, какую из четырёх величин, на каких звонках и на каком языке измеряли.

Иначе говоря, точность — не свойство инструмента, а результат, который он показывает на ваших звонках и по вашим критериям. Измерить её можно только на собственном эталонном наборе.

Четыре отдельные меры

  1. Качество транскриптаНасколько верно речь переведена в текст. Общая доля ошибок в словах полезна, но для оценки важнее ключевые слова: цена, дата, название продукта, обязательная фраза.
  2. Согласие по критериюДля каждого критерия — доля звонков, где ответ AI совпал с эталоном. Считается по каждому критерию отдельно: один может работать хорошо, другой плохо.
  3. Тип ошибкиНа критическом критерии две ошибки ведут к разным последствиям: ложный флаг несправедливо обвиняет оператора, пропущенное нарушение скрывает риск. Они считаются отдельно.
  4. Неанализируемые звонкиДоля звонков, которые нельзя надёжно оценить из-за качества звука, языка или разделения говорящих. Они исключаются из расчёта согласия и показываются отдельно.

Иллюстративный пример: что скрывают 89% согласия

Цифры ниже — иллюстративный пример, а не реальные результаты какого-либо инструмента. Критический критерий: «оператор произнёс обязательное раскрытие». Из 108 звонков 8 не удалось проанализировать из-за качества записи; оставшиеся 100 сравнили с эталоном людей. По эталону раскрытие прозвучало в 80 звонках и не прозвучало в 20.

  1. 80 звонков с раскрытиемAI ответил «прозвучало» в 74 и «не прозвучало» в 6. Эти 6 — ложные флаги.
  2. 20 звонков без раскрытияAI ответил «не прозвучало» в 15 и «прозвучало» в 5. Эти 5 — пропущенные нарушения.
89%Общее согласие: (74 + 15) / 100
25%Доля пропущенных реальных нарушений: 5 / 20
29%Доля ложных флагов: 6 из 21

89% выглядит хорошо. Но четверть реальных нарушений не найдена, а примерно каждый третий поднятый флаг ошибочен. К тому же 8 из 108 звонков не оценены вовсе — охват 92,6%. В отчёте должны быть все четыре цифры вместе, а не только 89%.

Как строится эталонный набор

  • Звонки отражают реальный поток: разные операторы, типы звонков, языки и качество записи
  • На критических критериях достаточно случаев «да» и «нет» — для редких нарушений может понадобиться целевой отбор
  • Каждый звонок независимо оценивают два человека, расхождения решаются обсуждением
  • Эталонный набор остаётся неизменным, чтобы при смене критерия или модели сравнивать на тех же звонках
  • Те, кто готовит эталон, не видят результат AI заранее

Показатель уверенности — не вероятность

Многие системы дают показатель уверенности для строки транскрипта или решения. Это полезный сигнал — на строки с низкой уверенностью стоит смотреть внимательнее. Но «0,9» не значит, что 90% таких решений верны. Чтобы так его читать, показатель нужно откалибровать на ваших звонках, то есть проверить по эталону.

Практичный подход: используйте уверенность для сортировки и отбора, а не как вероятность. На эталонном наборе проверьте, действительно ли в решениях с низкой уверенностью больше ошибок.

Поиск причины расхождения

Для каждого случая, где AI и эталон расходятся, причина относится к одной категории. Этот список показывает, что нужно исправлять:

  1. Ошибка транскриптаСлово распознано неверно или потеряно. Решение: качество записи, словарь терминов.
  2. Ошибка говорящегоСтрока отнесена не к той стороне. Решение: запись на раздельных каналах, проверка диаризации.
  3. Формулировка критерияКритерий можно понять двояко. Решение: уточнить его и добавить примеры «да» и «нет».
  4. Разница трактовкиТранскрипт и критерий ясны, но AI пришёл к другому выводу. Решение: больше примеров и проверка этого критерия человеком.
  5. Ошибка эталонаПри повторном просмотре выясняется, что ошибся человек. Эталон исправляется — люди тоже не безошибочны.

Постоянный контроль точности

Однажды измеренная точность со временем меняется: новый продукт, новый скрипт, новые операторы, новый поток клиентов. В руководстве AWS по генеративной оценке тоже отмечено, что AI-оценки не точны на 100%, выборки нужно регулярно проверять людьми, а ручной процесс оценки — сохранять, чтобы замечать дрейф.

  • Каждый месяц небольшая выборка заново оценивается людьми
  • При изменении критерия или стандарта звонка эталонный набор перепроверяется по новой версии
  • Если на критическом критерии согласие падает, критерий временно возвращается на проверку людьми
  • Возражения операторов — тоже сигнал: на каких критериях скапливаются подтверждённые возражения?

Отчёт о точности на одной странице

Информация о точности для руководства и операторов должна быть краткой, но полной. Структура ниже — иллюстративный пример:

  1. КонтекстКакой тип звонков, какие языки, какой период, сколько звонков в эталонном наборе, какая версия стандарта звонка.
  2. ОхватСколько звонков удалось проанализировать, сколько нет и основные причины.
  3. Таблица критериевСогласие по каждому критерию; для критических — дополнительно доля пропущенных нарушений и ложных флагов.
  4. Правило примененияКакие критерии используются как автоматический результат, а какие проходят проверку человеком.
  5. Следующая проверкаКогда и после каких изменений измерение будет повторено.

Если делиться этим отчётом с операторами, растёт доверие: они знают, где система сильна, а где слаба, и могут привязывать свои возражения к конкретному критерию.

Типичные ошибки

  • Считать общую цифру точности от поставщика верной и для ваших звонков
  • Считать только общее согласие, не разделяя типы ошибок
  • Тихо исключать неанализируемые звонки и не показывать охват
  • Готовить эталон, глядя на результат AI
  • Ссылаться на старую цифру точности после изменения критерия

Ограничения

  • Измеренная точность относится только к этому эталонному набору — тип звонков, язык, качество записи
  • Для надёжной цифры по редким нарушениям нужно много звонков; процент по малой выборке читается осторожно
  • Показатель уверенности модели нельзя подавать как вероятность без калибровки
  • Никакой уровень точности не делает результат AI единственным основанием решения об операторе

Что есть в Vexvon Audio Analyzer

  • Каждая строка транскрипта приходит с уверенностью распознавания; строки с низкой уверенностью помечены
  • У каждого шага стандарта звонка есть статус, комментарий и строки-доказательства — данные, нужные для сравнения с эталоном и поиска причины расхождения
  • После исправления критериев те же эталонные звонки можно переанализировать по существующему транскрипту — для прямого сравнения результатов
  • Общего процента точности нет: точность нужно измерять на вашем эталонном наборе

Подробнее: Vexvon Audio Analyzer. Как построить эталонный набор в пилоте, — в статье пилот речевой аналитики, влияние качества записи — в статье качество записи звонка, проверка по языкам — в статье многоязычная оценка звонков.

Первый шаг

Выберите один критический критерий и подготовьте эталонный набор из 50–100 звонков. Сравните с ним результат AI и запишите четыре цифры: согласие, пропущенные нарушения, ложные флаги и неанализируемые звонки. Статья входит в раздел внедрение и надёжность аудиоанализа. Чтобы проверить подход на своих записях, свяжитесь с нами.

Продолжение темы: калибровка оценки звонков.

Live demo

Ready? Let's start

See Vexvon live in a 10-minute demo.

  • A scenario built for your business
  • A live sample call
  • A tour of the platform
Get a demoorBook a meeting

Your details are used only for the demo and to get in touch.