AI и специалист по качеству оценили по-разному: калибровка оценки звонков
Когда AI и специалист по качеству расходятся в оценке, ни один не прав автоматически. В этом материале мы пошагово выстраиваем калибровку оценки звонков: недостатки оценки человеком, ход сессии, иллюстративная таблица расхождений, пять причин и их решения, процент совпадения, обманчивый на редких событиях, и периодичность калибровки.
Короткий ответ
Если AI и специалист по качеству оценили один звонок по-разному, ни одного из них нельзя автоматически считать правым. Правильный шаг — калибровка оценки звонков: независимо оценить одни и те же звонки, сравнить расхождения по каждому критерию, найти причину каждого и исправить критерий или процесс. Причина часто не в AI и не в человеке, а в самом критерии: стороны понимают его по-разному.
Итог калибровки — не «кто победил», а более ясный критерий, задокументированное решение и меньше расхождений на следующей проверке.
Оценка человека тоже не безупречна
Оценку специалиста по качеству обычно принимают за «правильный ответ», но у людей тоже есть систематические ошибки. К концу дня усталость смягчает критерии; хорошее или плохое впечатление от начала звонка переносится на остальные критерии; оценщик, знающий оператора, может относиться к нему иначе. Два опытных специалиста могут оценить один звонок по-разному.
Руководство Google по Quality AI требует, чтобы на примерах для обучения модели несколько оценщиков-людей отвечали согласованно, потому что несогласованность создаёт шум. Этот принцип верен для любой системы: если люди не согласны между собой, ждать от AI согласия с ними бессмысленно.
Калибровочная сессия шаг за шагом
- ПодготовкаВыберите 10–15 звонков: разные типы, разные баллы, хотя бы несколько спорных случаев. Разошлите всем карточки определений критериев.
- Независимая оценкаМинимум два специалиста оценивают звонки, не видя результата AI.
- Таблица расхожденийПо каждому звонку и критерию рядом записываются три результата: AI, первый и второй специалист.
- Обсуждение причинОбсуждаются только строки с расхождением. Для каждого выбирается категория причины (ниже).
- Решение и записьЗаписывается правильное прочтение критерия; при необходимости карточка меняется и фиксируется как новая версия.
- Повторный тестТе же звонки оцениваются заново с новым текстом критерия. Если расхождения уменьшились, исправление сработало.
Иллюстративная таблица расхождений
Пример из пяти строк — не реальные звонки:
- Звонок 2, «следующий шаг»: AI — нет, QA1 — да, QA2 — да. Причина: оператор сказал «позвоню завтра в 11», но строку приписали клиенту — ошибка говорящего
- Звонок 4, «условия цены»: AI — да, QA1 — частично, QA2 — нет. Причина: в критерии не сказано, что считается «условием», — формулировка критерия
- Звонок 7, «подтверждение личности»: AI — неприменимо, QA1 — нет, QA2 — нет. Причина: AI неверно определил тип звонка — ошибка AI
- Звонок 9, «выяснение потребности»: AI — да, QA1 — да, QA2 — нет. Причина: QA2 не счёл один вопрос достаточным — расхождение между людьми
- Звонок 12, «цена верна»: AI — да, QA1 — нет, QA2 — нет. Причина: в этот день цена изменилась, AI этого знать не может — внешние данные
Пять причин расхождений и их решения
- Формулировка критерияСамая частая причина. Решение: добавьте в карточку условия «да», «частично» и «неприменимо» и нестандартные примеры.
- Ошибка транскрипта или говорящегоРешение: проверяйте данные, а не критерий, — качество записи, возможность стерео; ставьте такие звонки в очередь проверки.
- Ошибка AIКритерий ясен, транскрипт верен, а результат неверен. Решение: разбейте критерий на более простые вопросы; если не помогает, оставьте по нему проверку человеком.
- Расхождение между людьмиРешение: совместное обучение специалистов и уточнение карточки — AI менять не нужно.
- Внешние данныеРезультат зависит от информации, которой нет в транскрипте. Решение: пометьте критерий как «требует внешней проверки» и оставьте его оценку людям.
Как измерять совпадение: обманчивый процент
Самая простая мера — процент совпадения по критерию: в скольких звонках AI и человек пришли к одному результату. Но для редких событий этот процент обманчив. Иллюстративный пример: в 38 из 40 звонков оператор поздоровался. AI написал «да» во всех 40. Совпадение выглядит как 38 ÷ 40 = 95%, но AI не поймал ни одного из двух звонков, где приветствие пропущено.
Когда проводить калибровку
- До запуска — прежде чем форму объявят операторам
- Раз в месяц в первые три месяца
- После каждого изменения критерия — тест новой версии на старых звонках
- При добавлении нового типа звонков, продукта или языка
- Когда апелляции операторов резко выросли по одному критерию
Запись калибровки: что фиксировать
Ценность сессии остаётся в записи. По каждому решению ведите короткую запись в одном формате:
- Дата, участники и список рассмотренных звонков
- Критерий и его текст до сессии
- Категория причины расхождения и пример звонка
- Принятое толкование — одно предложение для будущих оценщиков
- Новый текст критерия и номер версии
- Последствия: какие прошлые результаты пересмотреть и сообщат ли операторам
Такая запись — лучший учебный материал для нового специалиста, а при апелляции оператора она показывает, почему критерий толкуется именно так.
Ограничения
Калибровка проводится на небольшой выборке, и её результат верен только для этих типов звонков. Высокое совпадение по одному критерию ничего не говорит о другом. Если решения сессии не записаны, через три месяца повторится тот же спор. И если калибровка меняет результат оператора, ему нужно об этом сообщить — особенно если результат уже с ним обсуждали.
Калибровка в Vexvon Audio Analyzer
Vexvon Audio Analyzer упрощает несколько шагов калибровки. Каждый статус приходит со строками-доказательствами, поэтому обсуждение расхождения переходит от мнений к фактам. В транскрипте хранится исходная метка говорящего — неверное разделение можно отследить. Главное: после исправления текста критерия существующий транскрипт переоценивается без повторной обработки аудио, а версия стандарта фиксируется в каждом звонке. «Повторный тест» занимает минуты, а не дни.
Сама сессия — кто оценивает, таблица расхождений, запись решения — ваш процесс. О структуре доказательств — в материале об оценке с доказательствами, о проверочной выборке — о выборочной проверке звонков.
Первый шаг
Проведите первую сессию на десяти звонках на следующей неделе: два специалиста, результат AI и таблица расхождений. Каждому расхождению присвойте одну из пяти причин и начните с самой частой. Другие материалы — в рубрике оценка операторов; чтобы подготовить сессию вместе, свяжитесь с нами.
Продолжение темы: версии оценочного листа, точность анализа звонков.