Skip to main content
Данные, таксономия и надёжность

Проверка AI-категоризации: когда человек должен смотреть

Категории AI выглядят убедительно, но при размытом определении число остаётся стабильным и считает не то. В статье — проверка AI-категоризации: два вида ошибок, слепой выборочный аудит, когда проверка обязательна, цикл калибровки и рабочий лист проверяющего.

5 октября 20265 мин чтения

Короткий ответ

Категории, которые AI присваивает разговорам, человек обязательно должен проверять в пяти случаях: при первом включении поля, при изменении его определения или списка значений, при резком изменении доли значения, когда результат станет основой важного решения, и для редких, но серьёзных значений. В остальное время достаточно небольшой регулярной выборочной проверки: 30–50 результатов по каждому главному полю в неделю.

Цель проверки — не «поставить оценку» AI, а найти две разные ошибки: ложноположительную (разговор не относится к значению, но AI его туда записал) и ложноотрицательную (разговор относится к значению, но AI записал его в другое место). Исправляются они по-разному.

Зачем нужна проверка

Категории AI выглядят убедительно: аккуратная метка у каждого разговора, точные проценты в отчёте. Но процент точен ровно настолько, насколько верны метки. Если определение поля размыто, AI может систематически ошибаться, и в отчёте эта ошибка не видна: число выглядит стабильным и логичным — просто считает не то.

Это не значит, что AI «плохой». Два человека тоже по-разному понимают одно определение. Проверка нужна, чтобы показать, что определение работает.

Два вида ошибок

  1. ЛожноположительнаяAI записал разговор в «возражение по цене», а клиент лишь спросил цену и не возражал. Итог: доля значения завышена.
  2. ЛожноотрицательнаяКлиент сказал «для меня это дорого», а AI записал в «другое» или другое значение. Итог: доля значения занижена, проблема не видна.

Простыми словами, одна измеряется точностью (из разговоров, которые AI отнёс к значению, сколько действительно к нему относятся), другая — полнотой (из разговоров, действительно относящихся к значению, сколько AI нашёл). Что важнее, зависит от решения: для редкого серьёзного события (юридическая жалоба) важно ничего не пропустить, то есть полнота; для отчёта о трендах — баланс обеих.

Как построить выборочный аудит

  1. ОтборПо 10–15 случайных разговоров из каждого значения плюс 10–15 из «другого». Если брать только самое крупное значение, ошибки в редких значениях останутся скрытыми.
  2. Слепое чтениеПроверяющий сначала пишет свой ответ, не глядя на выбор AI, затем сравнивает.
  3. ЗаписьДля каждого расхождения: что выбрал AI, что выбрал человек и почему (размытое определение, короткий разговор, нет контекста).
  4. РасчётДля каждого значения — доля верных выборов и разговоры, ошибочно попавшие в «другое».

Когда проверка обязательна

  • Первый запуск: в первые 1–2 недели проверяется каждое значение.
  • Изменение определения или значений: после изменения проверяются новые результаты.
  • Резкое изменение доли: доля значения быстро растёт или падает — проверьте, реальное ли это изменение или ошибка анализа.
  • Важное решение: результат, на который опирается решение о бюджете, цене, продукте или персонале.
  • Редкие серьёзные значения: каждый найденный случай читает человек.

Цикл калибровки

  1. ПроверкаЕженедельный выборочный аудит.
  2. ПричинаСистематические ошибки группируются: какие два значения путаются, какую формулировку AI не узнаёт.
  3. ИсправлениеСтрока «не входит» в определении, новый пример или объединение значений.
  4. Повторный анализЕсли определение существенно изменилось, разговоры за последний период анализируются заново.
  5. Повторная проверкаНа следующей неделе проверяются те же значения — ошибок стало меньше?

Какой точности достаточно

Универсального порога нет, а показатели точности вендоров обычно измерены на других данных и других языках. Задайте свой порог по решению: для отслеживания трендов важно, чтобы точность была стабильной от периода к периоду; если по доле значения будет приниматься бюджетное решение, это значение нужно проверять строже; если предстоит связываться с конкретными клиентами, каждый найденный случай нужно прочитать.

Иллюстративный пример

Это иллюстративный пример. Учебный центр включает поле «причина потери», и в первую неделю значение «цена» показывает половину потерь. Слепой аудит обнаруживает, что несколько из 15 результатов «цена» на деле — «не подходит расписание»: клиент писал «за эту цену есть группа выходного дня?», а AI выбрал по слову «цена».

В определение добавляют границу: «цена — клиент возражает против самой цены; вопросы о расписании, формате или месте сюда не относятся». После повторного анализа доля «цены» падает, значение «расписание» растёт, и решение меняется: вместо скидки открывают группу выходного дня.

Рабочий лист проверяющего

  • Ссылка на разговор.
  • Значение, выбранное AI, и фраза-доказательство.
  • Значение проверяющего (после слепого чтения).
  • Совпадение: да / нет.
  • Причина ошибки: определение, короткий разговор, контекст, язык, другое.
  • Предлагаемое исправление.

Типичные ошибки

  • Проверять только в первую неделю, а потом забыть.
  • Проверять только самые крупные значения.
  • Смотреть на выбор AI и говорить «да, верно» — без слепого чтения появляется предвзятость подтверждения.
  • Найти ошибку и не исправить определение.

Границы

  • Малая выборка ловит только грубые ошибки; для измерения точности редких значений нужно больше разговоров.
  • Проверяющий-человек тоже ошибается — двое проверяющих и ясное определение это снижают.
  • Категория AI не должна быть единственным основанием для решения с высокими рисками о клиенте или сотруднике.

Что есть в Vexvon для проверки

В Vexvon у каждого результата хранятся собственная фраза клиента и ссылка на это сообщение, а список разговоров за каждым значением можно открыть — это то, что нужно для выборочного аудита. Частота повторения фраз из «другого» видна отдельно. После изменения определения или списка значений старые разговоры можно принудительно проанализировать заново; каждый анализ сохраняет снимок определений полей на тот момент, чтобы позже ответить на вопрос «почему выбрано это значение?». Подробнее: аналитика Vexvon.

Следующий шаг

На этой неделе вслепую проверьте по 10 разговоров на каждое значение в самом важном поле и запишите расхождения. Для двух самых путаемых значений пропишите границу. Правила таксономии — в статье таксономия аналитики разговоров; аудит можно настроить вместе на демо.

Продолжение темы: статус «неизвестно» в аналитике, анализ всех разговоров с клиентами.

Live demo

Ready? Let's start

See Vexvon live in a 10-minute demo.

  • A scenario built for your business
  • A live sample call
  • A tour of the platform
Get a demoorBook a meeting

Your details are used only for the demo and to get in touch.