AI və QA mütəxəssisi fərqli bal verirsə: qiymətləndirmə kalibrasiyası necə aparılır
AI ilə keyfiyyət mütəxəssisi fərqli bal verəndə heç biri avtomatik doğru deyil. Bu yazıda qiymətləndirmə kalibrasiyasını addım-addım qururuq: insan balının öz qüsurları, sessiyanın gedişi, illüstrativ fərq cədvəli, fərqin beş səbəbi və həlli, nadir hallarda aldadıcı uyğunluq faizi və kalibrasiyanın ritmi.
Qısa cavab
AI ilə keyfiyyət mütəxəssisi eyni zəngə fərqli bal veribsə, avtomatik olaraq heç biri doğru sayılmamalıdır. Düzgün addım qiymətləndirmə kalibrasiyasıdır — yəni eyni zəngləri müstəqil qiymətləndirib fərqləri meyar-meyar müqayisə etmək, hər fərqin səbəbini tapmaq və meyarı və ya prosesi düzəltməkdir. Fərqin səbəbi çox vaxt nə AI-da, nə insandadır, meyarın özündədir: onu iki tərəf fərqli başa düşür.
Kalibrasiyanın nəticəsi «kim qalib gəldi» deyil, daha aydın meyar, sənədləşdirilmiş qərar və növbəti yoxlamada daha az fərqdir.
İnsan balı da qüsursuz deyil
Keyfiyyət mütəxəssisinin qiymətləndirməsi adətən «düzgün cavab» kimi qəbul olunur, amma insanın da sistemli səhvləri var. Günün sonunda yorğunluq meyarları yumşaldır; zəngin əvvəlindəki yaxşı və ya pis təəssürat qalan meyarlara yayılır; operatoru tanıyan qiymətləndirici ona fərqli yanaşa bilir. İki təcrübəli mütəxəssis eyni zəngə fərqli bal verə bilir.
Google-un Quality AI təlimatı modeli öyrətmək üçün nümunələrdə bir neçə insan qiymətləndiricinin ardıcıl cavab verməsini tələb edir, çünki uyğunsuzluq səs-küy yaradır. Bu prinsip hər sistemə aiddir: insanlar öz aralarında razılaşmırsa, AI-dan onlarla razılaşmasını gözləmək mənasızdır.
Kalibrasiya sessiyası addım-addım
- Hazırlıq10–15 zəng seçin: fərqli növ, fərqli bal, ən azı bir neçə mübahisəli hal. Meyarların tərif kartlarını hamıya göndərin.
- Müstəqil qiymətləndirməƏn azı iki mütəxəssis zəngləri AI nəticəsini görmədən qiymətləndirir.
- Fərq cədvəliHər zəng və meyar üçün üç nəticə yan-yana yazılır: AI, birinci və ikinci mütəxəssis.
- Səbəb müzakirəsiYalnız fərqli olan sətirlər müzakirə olunur. Hər fərq üçün səbəb kateqoriyası seçilir (aşağıda).
- Qərar və qeydMeyarın düzgün şərhi yazılır, lazım olduqda tərif kartı dəyişdirilir və yeni versiya kimi qeyd olunur.
- Təkrar testYeni meyar mətni ilə eyni zənglər yenidən qiymətləndirilir. Fərq azalıbsa, düzəliş işləyib.
İllüstrativ fərq cədvəli
Beş sətirlik nümunə — real zənglər deyil:
- Zəng 2, «növbəti addım»: AI — xeyr, QA1 — bəli, QA2 — bəli. Səbəb: operator «sabah saat 11-də zəng edəcəyəm» deyib, amma sətir müştəriyə yazılıb — danışan xətası
- Zəng 4, «qiymətin şərtləri»: AI — bəli, QA1 — qismən, QA2 — xeyr. Səbəb: meyarda nəyin «şərt» sayıldığı yazılmayıb — meyarın yazılışı
- Zəng 7, «kimlik təsdiqi»: AI — tətbiq olunmur, QA1 — xeyr, QA2 — xeyr. Səbəb: AI zəng növünü səhv müəyyən edib — AI xətası
- Zəng 9, «ehtiyacın aydınlaşdırılması»: AI — bəli, QA1 — bəli, QA2 — xeyr. Səbəb: QA2 bir sualı kifayət saymayıb — insanlar arası uyğunsuzluq
- Zəng 12, «qiymət düzgündür»: AI — bəli, QA1 — xeyr, QA2 — xeyr. Səbəb: həmin gün qiymət dəyişib, AI bunu bilə bilməz — xarici məlumat
Fərqin beş səbəbi və həlli
- Meyarın yazılışıƏn çox rast gəlinən səbəb. Həll: tərif kartına «bəli», «qismən» və «tətbiq olunmur» şərtlərini və qeyri-standart nümunələri əlavə edin.
- Transkript və ya danışan xətasıHəll: meyarı yox, məlumatı yoxlayın — yazının keyfiyyəti, stereo yazı imkanı; belə zəngləri baxış növbəsinə salın.
- AI xətasıMeyar aydındır, transkript düzgündür, amma nəticə səhvdir. Həll: meyarı daha sadə suallara bölün; davam edirsə, bu meyarda insan yoxlamasını saxlayın.
- İnsanlar arası uyğunsuzluqHəll: mütəxəssislərin birgə təlimi və tərif kartının dəqiqləşdirilməsi — AI-ı dəyişməyə ehtiyac yoxdur.
- Xarici məlumatNəticə transkriptdə olmayan məlumatdan asılıdır. Həll: meyarı «xarici yoxlama tələb edir» kimi işarələyin və yalnız insan qiymətləndirsin.
Uyğunluğu necə ölçmək: aldadıcı faiz
Ən sadə ölçü meyar üzrə uyğunluq faizidir: AI ilə insan neçə zəngdə eyni nəticəyə gəlib. Amma nadir hallarda bu faiz aldadır. İllüstrativ nümunə: 40 zəngin 38-də operator salamlaşıb. AI hər 40 zəngə «bəli» yazıb. Uyğunluq 38 ÷ 40 = 95% görünür — amma AI salamlaşmanın buraxıldığı iki zəngin heç birini tutmayıb.
Kalibrasiya nə vaxt keçirilməlidir
- İşə salmazdan əvvəl — forma operatorlara elan olunmamışdan
- İlk üç ay ərzində ayda bir dəfə
- Hər meyar dəyişikliyindən sonra — yeni versiyanın köhnə zənglərlə testi
- Yeni zəng növü, məhsul və ya dil əlavə olunanda
- Operatorların etirazları bir meyarda birdən artanda
Kalibrasiya qeydi: nə yazılmalıdır
Sessiyanın dəyəri qeyddə qalır. Hər qərar üçün qısa, eyni formatlı qeyd saxlayın:
- Tarix, iştirakçılar və baxılan zənglərin siyahısı
- Meyar və onun sessiyadan əvvəlki mətni
- Fərqin səbəb kategoriyası və nümunə zəng
- Qəbul olunan şərh — bir cümlə, gələcək qiymətləndiricilər üçün
- Meyarın yeni mətni və versiya nömrəsi
- Təsir: hansı köhnə nəticələr yenidən baxılmalıdır və operatorlara bildiriləcəkmi
Belə qeyd yeni işə başlayan mütəxəssis üçün ən yaxşı təlim materialıdır və operator etiraz edəndə meyarın niyə belə şərh edildiyini göstərir.
Hüdudlar
Kalibrasiya kiçik nümunədə aparılır və nəticəsi yalnız həmin zəng növləri üçün doğrudur. Yüksək uyğunluq bir meyarda o biri meyar haqqında heç nə demir. Sessiyanın qərarları yazılmasa, üç aydan sonra eyni mübahisə təkrarlanır. Və kalibrasiya operatorun nəticəsini dəyişirsə, bu dəyişiklik operatora bildirilməlidir — xüsusən nəticə artıq onunla müzakirə edilibsə.
Vexvon Audio Analyzer-də kalibrasiya
Vexvon Audio Analyzer kalibrasiyanın bir neçə addımını sadələşdirir. Hər status sübut sətirləri ilə gəldiyi üçün fərq müzakirəsi rəydən faktlara keçir. Transkriptdə danışanın xam etiketi saxlanılır — yanlış ayrılma izlənə bilir. Ən vacibi: meyar mətnini düzəltdikdən sonra mövcud transkript audionu yenidən emal etmədən təkrar qiymətləndirilir, standartın versiyası isə hər zəngdə qeyd olunur. Beləliklə, «təkrar test» addımı günlər yox, dəqiqələr çəkir.
Sessiyanın özü — kim qiymətləndirir, fərq cədvəli, qərar qeydi — sizin prosesinizdir. Sübutun quruluşu üçün sübutlu qiymətləndirmə, yoxlama nümunəsi üçün seçmə yoxlama yazılarına baxın.
İlk addım
Növbəti həftə 10 zənglik ilk sessiyanı keçirin: iki mütəxəssis, AI nəticəsi və fərq cədvəli. Hər fərqə beş səbəbdən birini yazın və ən çox təkrarlanan səbəbdən başlayın. Digər yazılar operator qiymətləndirməsi bölməsindədir; sessiyanı birlikdə hazırlamaq üçün bizimlə əlaqə saxlayın.
Mövzunun davamı: scorecard versiyası, zəng analizinin dəqiqliyi.
- Operator qiymətləndirməsi5 dəq oxuOperatorun AI balına etiraz prosesi necə qurulmalıdır
- Operator qiymətləndirməsi5 dəq oxuAI operatora niyə bu balı verdi: sitat və transkript sətri ilə sübutlu qiymətləndirmə
- Operator qiymətləndirməsi5 dəq oxu«Xeyr», «Tətbiq olunmur» və «Qiymətləndirmək mümkün deyil»: scoring-də fərq