Skip to main content
Оценка операторов

AI и специалист по качеству оценили по-разному: калибровка оценки звонков

Когда AI и специалист по качеству расходятся в оценке, ни один не прав автоматически. В этом материале мы пошагово выстраиваем калибровку оценки звонков: недостатки оценки человеком, ход сессии, иллюстративная таблица расхождений, пять причин и их решения, процент совпадения, обманчивый на редких событиях, и периодичность калибровки.

29 сентября 20265 мин чтения

Короткий ответ

Если AI и специалист по качеству оценили один звонок по-разному, ни одного из них нельзя автоматически считать правым. Правильный шаг — калибровка оценки звонков: независимо оценить одни и те же звонки, сравнить расхождения по каждому критерию, найти причину каждого и исправить критерий или процесс. Причина часто не в AI и не в человеке, а в самом критерии: стороны понимают его по-разному.

Итог калибровки — не «кто победил», а более ясный критерий, задокументированное решение и меньше расхождений на следующей проверке.

Оценка человека тоже не безупречна

Оценку специалиста по качеству обычно принимают за «правильный ответ», но у людей тоже есть систематические ошибки. К концу дня усталость смягчает критерии; хорошее или плохое впечатление от начала звонка переносится на остальные критерии; оценщик, знающий оператора, может относиться к нему иначе. Два опытных специалиста могут оценить один звонок по-разному.

Руководство Google по Quality AI требует, чтобы на примерах для обучения модели несколько оценщиков-людей отвечали согласованно, потому что несогласованность создаёт шум. Этот принцип верен для любой системы: если люди не согласны между собой, ждать от AI согласия с ними бессмысленно.

Калибровочная сессия шаг за шагом

  1. ПодготовкаВыберите 10–15 звонков: разные типы, разные баллы, хотя бы несколько спорных случаев. Разошлите всем карточки определений критериев.
  2. Независимая оценкаМинимум два специалиста оценивают звонки, не видя результата AI.
  3. Таблица расхожденийПо каждому звонку и критерию рядом записываются три результата: AI, первый и второй специалист.
  4. Обсуждение причинОбсуждаются только строки с расхождением. Для каждого выбирается категория причины (ниже).
  5. Решение и записьЗаписывается правильное прочтение критерия; при необходимости карточка меняется и фиксируется как новая версия.
  6. Повторный тестТе же звонки оцениваются заново с новым текстом критерия. Если расхождения уменьшились, исправление сработало.

Иллюстративная таблица расхождений

Пример из пяти строк — не реальные звонки:

  • Звонок 2, «следующий шаг»: AI — нет, QA1 — да, QA2 — да. Причина: оператор сказал «позвоню завтра в 11», но строку приписали клиенту — ошибка говорящего
  • Звонок 4, «условия цены»: AI — да, QA1 — частично, QA2 — нет. Причина: в критерии не сказано, что считается «условием», — формулировка критерия
  • Звонок 7, «подтверждение личности»: AI — неприменимо, QA1 — нет, QA2 — нет. Причина: AI неверно определил тип звонка — ошибка AI
  • Звонок 9, «выяснение потребности»: AI — да, QA1 — да, QA2 — нет. Причина: QA2 не счёл один вопрос достаточным — расхождение между людьми
  • Звонок 12, «цена верна»: AI — да, QA1 — нет, QA2 — нет. Причина: в этот день цена изменилась, AI этого знать не может — внешние данные

Пять причин расхождений и их решения

  1. Формулировка критерияСамая частая причина. Решение: добавьте в карточку условия «да», «частично» и «неприменимо» и нестандартные примеры.
  2. Ошибка транскрипта или говорящегоРешение: проверяйте данные, а не критерий, — качество записи, возможность стерео; ставьте такие звонки в очередь проверки.
  3. Ошибка AIКритерий ясен, транскрипт верен, а результат неверен. Решение: разбейте критерий на более простые вопросы; если не помогает, оставьте по нему проверку человеком.
  4. Расхождение между людьмиРешение: совместное обучение специалистов и уточнение карточки — AI менять не нужно.
  5. Внешние данныеРезультат зависит от информации, которой нет в транскрипте. Решение: пометьте критерий как «требует внешней проверки» и оставьте его оценку людям.

Как измерять совпадение: обманчивый процент

Самая простая мера — процент совпадения по критерию: в скольких звонках AI и человек пришли к одному результату. Но для редких событий этот процент обманчив. Иллюстративный пример: в 38 из 40 звонков оператор поздоровался. AI написал «да» во всех 40. Совпадение выглядит как 38 ÷ 40 = 95%, но AI не поймал ни одного из двух звонков, где приветствие пропущено.

95%общее совпадение
0 / 2пойманных случаев «нет»
38 / 40звонков с «да»

Когда проводить калибровку

  • До запуска — прежде чем форму объявят операторам
  • Раз в месяц в первые три месяца
  • После каждого изменения критерия — тест новой версии на старых звонках
  • При добавлении нового типа звонков, продукта или языка
  • Когда апелляции операторов резко выросли по одному критерию

Запись калибровки: что фиксировать

Ценность сессии остаётся в записи. По каждому решению ведите короткую запись в одном формате:

  • Дата, участники и список рассмотренных звонков
  • Критерий и его текст до сессии
  • Категория причины расхождения и пример звонка
  • Принятое толкование — одно предложение для будущих оценщиков
  • Новый текст критерия и номер версии
  • Последствия: какие прошлые результаты пересмотреть и сообщат ли операторам

Такая запись — лучший учебный материал для нового специалиста, а при апелляции оператора она показывает, почему критерий толкуется именно так.

Ограничения

Калибровка проводится на небольшой выборке, и её результат верен только для этих типов звонков. Высокое совпадение по одному критерию ничего не говорит о другом. Если решения сессии не записаны, через три месяца повторится тот же спор. И если калибровка меняет результат оператора, ему нужно об этом сообщить — особенно если результат уже с ним обсуждали.

Калибровка в Vexvon Audio Analyzer

Vexvon Audio Analyzer упрощает несколько шагов калибровки. Каждый статус приходит со строками-доказательствами, поэтому обсуждение расхождения переходит от мнений к фактам. В транскрипте хранится исходная метка говорящего — неверное разделение можно отследить. Главное: после исправления текста критерия существующий транскрипт переоценивается без повторной обработки аудио, а версия стандарта фиксируется в каждом звонке. «Повторный тест» занимает минуты, а не дни.

Сама сессия — кто оценивает, таблица расхождений, запись решения — ваш процесс. О структуре доказательств — в материале об оценке с доказательствами, о проверочной выборке — о выборочной проверке звонков.

Первый шаг

Проведите первую сессию на десяти звонках на следующей неделе: два специалиста, результат AI и таблица расхождений. Каждому расхождению присвойте одну из пяти причин и начните с самой частой. Другие материалы — в рубрике оценка операторов; чтобы подготовить сессию вместе, свяжитесь с нами.

Продолжение темы: версии оценочного листа, точность анализа звонков.

Live demo

Ready? Let's start

See Vexvon live in a 10-minute demo.

  • A scenario built for your business
  • A live sample call
  • A tour of the platform
Get a demoorBook a meeting

Your details are used only for the demo and to get in touch.