Точность анализа звонков: как измерять AI-оценку
Фраза «наша система точна на 90%» бесполезна, если не сказано, что измеряли, на каких звонках и на каком языке. В статье точность AI-анализа звонков разложена на четыре отдельные меры, на иллюстративном расчёте показано, как 89% согласия могут скрывать пропуск четверти реальных нарушений, а также разобраны построение эталонного набора, почему показатель уверенности — не вероятность, анализ причин расхождений, отчёт о точности на одной странице и постоянный контроль.
Короткий ответ
Точность AI-анализа звонков не измеряется одним числом. Отдельно нужно измерять как минимум четыре вещи: качество транскрипта, согласие AI с эталоном людей по каждому критерию, тип ошибок на критических критериях — ложные флаги и пропущенные нарушения — и долю звонков, которые нельзя проанализировать. Фраза «наша система точна на 90%» бесполезна, если не сказано, какую из четырёх величин, на каких звонках и на каком языке измеряли.
Иначе говоря, точность — не свойство инструмента, а результат, который он показывает на ваших звонках и по вашим критериям. Измерить её можно только на собственном эталонном наборе.
Четыре отдельные меры
- Качество транскриптаНасколько верно речь переведена в текст. Общая доля ошибок в словах полезна, но для оценки важнее ключевые слова: цена, дата, название продукта, обязательная фраза.
- Согласие по критериюДля каждого критерия — доля звонков, где ответ AI совпал с эталоном. Считается по каждому критерию отдельно: один может работать хорошо, другой плохо.
- Тип ошибкиНа критическом критерии две ошибки ведут к разным последствиям: ложный флаг несправедливо обвиняет оператора, пропущенное нарушение скрывает риск. Они считаются отдельно.
- Неанализируемые звонкиДоля звонков, которые нельзя надёжно оценить из-за качества звука, языка или разделения говорящих. Они исключаются из расчёта согласия и показываются отдельно.
Иллюстративный пример: что скрывают 89% согласия
Цифры ниже — иллюстративный пример, а не реальные результаты какого-либо инструмента. Критический критерий: «оператор произнёс обязательное раскрытие». Из 108 звонков 8 не удалось проанализировать из-за качества записи; оставшиеся 100 сравнили с эталоном людей. По эталону раскрытие прозвучало в 80 звонках и не прозвучало в 20.
- 80 звонков с раскрытиемAI ответил «прозвучало» в 74 и «не прозвучало» в 6. Эти 6 — ложные флаги.
- 20 звонков без раскрытияAI ответил «не прозвучало» в 15 и «прозвучало» в 5. Эти 5 — пропущенные нарушения.
89% выглядит хорошо. Но четверть реальных нарушений не найдена, а примерно каждый третий поднятый флаг ошибочен. К тому же 8 из 108 звонков не оценены вовсе — охват 92,6%. В отчёте должны быть все четыре цифры вместе, а не только 89%.
Как строится эталонный набор
- Звонки отражают реальный поток: разные операторы, типы звонков, языки и качество записи
- На критических критериях достаточно случаев «да» и «нет» — для редких нарушений может понадобиться целевой отбор
- Каждый звонок независимо оценивают два человека, расхождения решаются обсуждением
- Эталонный набор остаётся неизменным, чтобы при смене критерия или модели сравнивать на тех же звонках
- Те, кто готовит эталон, не видят результат AI заранее
Показатель уверенности — не вероятность
Многие системы дают показатель уверенности для строки транскрипта или решения. Это полезный сигнал — на строки с низкой уверенностью стоит смотреть внимательнее. Но «0,9» не значит, что 90% таких решений верны. Чтобы так его читать, показатель нужно откалибровать на ваших звонках, то есть проверить по эталону.
Практичный подход: используйте уверенность для сортировки и отбора, а не как вероятность. На эталонном наборе проверьте, действительно ли в решениях с низкой уверенностью больше ошибок.
Поиск причины расхождения
Для каждого случая, где AI и эталон расходятся, причина относится к одной категории. Этот список показывает, что нужно исправлять:
- Ошибка транскриптаСлово распознано неверно или потеряно. Решение: качество записи, словарь терминов.
- Ошибка говорящегоСтрока отнесена не к той стороне. Решение: запись на раздельных каналах, проверка диаризации.
- Формулировка критерияКритерий можно понять двояко. Решение: уточнить его и добавить примеры «да» и «нет».
- Разница трактовкиТранскрипт и критерий ясны, но AI пришёл к другому выводу. Решение: больше примеров и проверка этого критерия человеком.
- Ошибка эталонаПри повторном просмотре выясняется, что ошибся человек. Эталон исправляется — люди тоже не безошибочны.
Постоянный контроль точности
Однажды измеренная точность со временем меняется: новый продукт, новый скрипт, новые операторы, новый поток клиентов. В руководстве AWS по генеративной оценке тоже отмечено, что AI-оценки не точны на 100%, выборки нужно регулярно проверять людьми, а ручной процесс оценки — сохранять, чтобы замечать дрейф.
- Каждый месяц небольшая выборка заново оценивается людьми
- При изменении критерия или стандарта звонка эталонный набор перепроверяется по новой версии
- Если на критическом критерии согласие падает, критерий временно возвращается на проверку людьми
- Возражения операторов — тоже сигнал: на каких критериях скапливаются подтверждённые возражения?
Отчёт о точности на одной странице
Информация о точности для руководства и операторов должна быть краткой, но полной. Структура ниже — иллюстративный пример:
- КонтекстКакой тип звонков, какие языки, какой период, сколько звонков в эталонном наборе, какая версия стандарта звонка.
- ОхватСколько звонков удалось проанализировать, сколько нет и основные причины.
- Таблица критериевСогласие по каждому критерию; для критических — дополнительно доля пропущенных нарушений и ложных флагов.
- Правило примененияКакие критерии используются как автоматический результат, а какие проходят проверку человеком.
- Следующая проверкаКогда и после каких изменений измерение будет повторено.
Если делиться этим отчётом с операторами, растёт доверие: они знают, где система сильна, а где слаба, и могут привязывать свои возражения к конкретному критерию.
Типичные ошибки
- Считать общую цифру точности от поставщика верной и для ваших звонков
- Считать только общее согласие, не разделяя типы ошибок
- Тихо исключать неанализируемые звонки и не показывать охват
- Готовить эталон, глядя на результат AI
- Ссылаться на старую цифру точности после изменения критерия
Ограничения
- Измеренная точность относится только к этому эталонному набору — тип звонков, язык, качество записи
- Для надёжной цифры по редким нарушениям нужно много звонков; процент по малой выборке читается осторожно
- Показатель уверенности модели нельзя подавать как вероятность без калибровки
- Никакой уровень точности не делает результат AI единственным основанием решения об операторе
Что есть в Vexvon Audio Analyzer
- Каждая строка транскрипта приходит с уверенностью распознавания; строки с низкой уверенностью помечены
- У каждого шага стандарта звонка есть статус, комментарий и строки-доказательства — данные, нужные для сравнения с эталоном и поиска причины расхождения
- После исправления критериев те же эталонные звонки можно переанализировать по существующему транскрипту — для прямого сравнения результатов
- Общего процента точности нет: точность нужно измерять на вашем эталонном наборе
Подробнее: Vexvon Audio Analyzer. Как построить эталонный набор в пилоте, — в статье пилот речевой аналитики, влияние качества записи — в статье качество записи звонка, проверка по языкам — в статье многоязычная оценка звонков.
Первый шаг
Выберите один критический критерий и подготовьте эталонный набор из 50–100 звонков. Сравните с ним результат AI и запишите четыре цифры: согласие, пропущенные нарушения, ложные флаги и неанализируемые звонки. Статья входит в раздел внедрение и надёжность аудиоанализа. Чтобы проверить подход на своих записях, свяжитесь с нами.
Продолжение темы: калибровка оценки звонков.