Проверка AI-категоризации: когда человек должен смотреть
Категории AI выглядят убедительно, но при размытом определении число остаётся стабильным и считает не то. В статье — проверка AI-категоризации: два вида ошибок, слепой выборочный аудит, когда проверка обязательна, цикл калибровки и рабочий лист проверяющего.
Короткий ответ
Категории, которые AI присваивает разговорам, человек обязательно должен проверять в пяти случаях: при первом включении поля, при изменении его определения или списка значений, при резком изменении доли значения, когда результат станет основой важного решения, и для редких, но серьёзных значений. В остальное время достаточно небольшой регулярной выборочной проверки: 30–50 результатов по каждому главному полю в неделю.
Цель проверки — не «поставить оценку» AI, а найти две разные ошибки: ложноположительную (разговор не относится к значению, но AI его туда записал) и ложноотрицательную (разговор относится к значению, но AI записал его в другое место). Исправляются они по-разному.
Зачем нужна проверка
Категории AI выглядят убедительно: аккуратная метка у каждого разговора, точные проценты в отчёте. Но процент точен ровно настолько, насколько верны метки. Если определение поля размыто, AI может систематически ошибаться, и в отчёте эта ошибка не видна: число выглядит стабильным и логичным — просто считает не то.
Это не значит, что AI «плохой». Два человека тоже по-разному понимают одно определение. Проверка нужна, чтобы показать, что определение работает.
Два вида ошибок
- ЛожноположительнаяAI записал разговор в «возражение по цене», а клиент лишь спросил цену и не возражал. Итог: доля значения завышена.
- ЛожноотрицательнаяКлиент сказал «для меня это дорого», а AI записал в «другое» или другое значение. Итог: доля значения занижена, проблема не видна.
Простыми словами, одна измеряется точностью (из разговоров, которые AI отнёс к значению, сколько действительно к нему относятся), другая — полнотой (из разговоров, действительно относящихся к значению, сколько AI нашёл). Что важнее, зависит от решения: для редкого серьёзного события (юридическая жалоба) важно ничего не пропустить, то есть полнота; для отчёта о трендах — баланс обеих.
Как построить выборочный аудит
- ОтборПо 10–15 случайных разговоров из каждого значения плюс 10–15 из «другого». Если брать только самое крупное значение, ошибки в редких значениях останутся скрытыми.
- Слепое чтениеПроверяющий сначала пишет свой ответ, не глядя на выбор AI, затем сравнивает.
- ЗаписьДля каждого расхождения: что выбрал AI, что выбрал человек и почему (размытое определение, короткий разговор, нет контекста).
- РасчётДля каждого значения — доля верных выборов и разговоры, ошибочно попавшие в «другое».
Когда проверка обязательна
- Первый запуск: в первые 1–2 недели проверяется каждое значение.
- Изменение определения или значений: после изменения проверяются новые результаты.
- Резкое изменение доли: доля значения быстро растёт или падает — проверьте, реальное ли это изменение или ошибка анализа.
- Важное решение: результат, на который опирается решение о бюджете, цене, продукте или персонале.
- Редкие серьёзные значения: каждый найденный случай читает человек.
Цикл калибровки
- ПроверкаЕженедельный выборочный аудит.
- ПричинаСистематические ошибки группируются: какие два значения путаются, какую формулировку AI не узнаёт.
- ИсправлениеСтрока «не входит» в определении, новый пример или объединение значений.
- Повторный анализЕсли определение существенно изменилось, разговоры за последний период анализируются заново.
- Повторная проверкаНа следующей неделе проверяются те же значения — ошибок стало меньше?
Какой точности достаточно
Универсального порога нет, а показатели точности вендоров обычно измерены на других данных и других языках. Задайте свой порог по решению: для отслеживания трендов важно, чтобы точность была стабильной от периода к периоду; если по доле значения будет приниматься бюджетное решение, это значение нужно проверять строже; если предстоит связываться с конкретными клиентами, каждый найденный случай нужно прочитать.
Иллюстративный пример
Это иллюстративный пример. Учебный центр включает поле «причина потери», и в первую неделю значение «цена» показывает половину потерь. Слепой аудит обнаруживает, что несколько из 15 результатов «цена» на деле — «не подходит расписание»: клиент писал «за эту цену есть группа выходного дня?», а AI выбрал по слову «цена».
В определение добавляют границу: «цена — клиент возражает против самой цены; вопросы о расписании, формате или месте сюда не относятся». После повторного анализа доля «цены» падает, значение «расписание» растёт, и решение меняется: вместо скидки открывают группу выходного дня.
Рабочий лист проверяющего
- Ссылка на разговор.
- Значение, выбранное AI, и фраза-доказательство.
- Значение проверяющего (после слепого чтения).
- Совпадение: да / нет.
- Причина ошибки: определение, короткий разговор, контекст, язык, другое.
- Предлагаемое исправление.
Типичные ошибки
- Проверять только в первую неделю, а потом забыть.
- Проверять только самые крупные значения.
- Смотреть на выбор AI и говорить «да, верно» — без слепого чтения появляется предвзятость подтверждения.
- Найти ошибку и не исправить определение.
Границы
- Малая выборка ловит только грубые ошибки; для измерения точности редких значений нужно больше разговоров.
- Проверяющий-человек тоже ошибается — двое проверяющих и ясное определение это снижают.
- Категория AI не должна быть единственным основанием для решения с высокими рисками о клиенте или сотруднике.
Что есть в Vexvon для проверки
В Vexvon у каждого результата хранятся собственная фраза клиента и ссылка на это сообщение, а список разговоров за каждым значением можно открыть — это то, что нужно для выборочного аудита. Частота повторения фраз из «другого» видна отдельно. После изменения определения или списка значений старые разговоры можно принудительно проанализировать заново; каждый анализ сохраняет снимок определений полей на тот момент, чтобы позже ответить на вопрос «почему выбрано это значение?». Подробнее: аналитика Vexvon.
Следующий шаг
На этой неделе вслепую проверьте по 10 разговоров на каждое значение в самом важном поле и запишите расхождения. Для двух самых путаемых значений пропишите границу. Правила таксономии — в статье таксономия аналитики разговоров; аудит можно настроить вместе на демо.
Продолжение темы: статус «неизвестно» в аналитике, анализ всех разговоров с клиентами.
- Данные, таксономия и надёжность5 мин чтенияТочность транскрипции и аналитика: как ошибки искажают результаты
- Данные, таксономия и надёжность5 мин чтенияИнтеграция аналитики разговоров с CRM: как связать данные звонков и чатов
- Данные, таксономия и надёжность5 мин чтенияТаксономия аналитики разговоров: как построить правильную систему категорий