IT · MAX
LLM funksiyasi sifatini qanday tekshirish: evals, LLM-as-judge va model almashganda regressiyalar
· 13 daqiqa oʻqish · ultrathink tahririyati
LLM funksiyasi sifati bir-ikkita muvaffaqiyatli javobdan olingan taassurot bilan emas, baholash toʻplami (evals) bilan tekshiriladi: har bir oʻzgarishda avtomatik ishga tushiriladigan, mezonlari aniq qatʼiy misollar bilan. Mezonlarning bir qismi kod bilan, bir qismi hakam-model (LLM-as-judge) bilan tekshiriladi, hakamning oʻzi esa odamlar baholari bilan solishtirilgan boʻlishi kerak. Bunday toʻplamsiz model yoki promptning har qanday almashinuvi — koʻr-koʻrona chiqarishdir.
Nega «chatda tekshirdim — ishlayapti» hisobga olinmaydi
Til modeli determinatsiyalanmagan va ifodalarga sezgir: beshta savolingizga yaxshi javob bergan funksiya foydalanuvchi beradigan oltinchisida muvaffaqiyatsizlikka uchrashi mumkin. Qoʻlda tekshirish esa takrorlanmaydi: promptni tuzatgandan keyin siz endi boshqa misollarni tekshirasiz va eskisi buzilganini sezmaysiz. Bundan tashqari, funksiya muallifi savollarni beixtiyor oʻziga qulay tarzda beradi, foydalanuvchilar esa ularni oʻzicha ifodalaydi.
Evals sifatni his-tuygʻudan oʻlchovga aylantiradi. Bu oddiy dasturlashdagi avtotestlar bilan bir xil tamoyil, faqat toʻgʻri javob koʻpincha yagona emasligi va oddiy satrlarni solishtirish bilan tekshirilmasligi hisobga olinadi. Testlar kabi evals ham yozilgan paytda emas, har bir keyingi oʻzgarishda qadrli.
Aynan nimani baholash kerak
«Sifat» oʻlchash uchun juda umumiy soʻz. Misollarni yigʻishdan oldin uni har birini tekshirish mumkin boʻlgan alohida mezonlarga ajrating. Mezonlar toʻplami vazifaga bogʻliq, lekin odatda quyidagilardan bir nechtasini oʻz ichiga oladi.
- Toʻgʻrilik: javob mohiyatan toʻgʻri yoki etalonga mos.
- Manbaga sodiqlik: hujjatlar bilan ishlaydigan funksiyalar uchun — javob faqat uzatilgan materialga tayanadi va hech narsani toʻqib chiqarmaydi.
- Toʻliqlik: javobda barcha majburiy elementlar bor.
- Format: tuzilma, uzunlik, til, JSON toʻgʻriligi, majburiy maydonlar mavjudligi.
- Koʻrsatmaga amal qilish: model soʻralganini qiladi va taqiqlanganini qilmaydi.
- Toʻgʻri rad etish: doiradan tashqari savollarga funksiya toʻqima bilan emas, rad yoki «bilmayman» bilan javob beradi.
- Ohang va uslub: mahsulotda qabul qilinganiga mosligi.
- Ekspluatatsiya xususiyatlari: kechikish, narx, xatolar va kesilgan javoblar ulushi.
Mezonlarni muhimlik boʻyicha tartiblash foydali. Toʻgʻrilikdagi xato yoki toʻqilgan fakt odatda juda uzun javobdan yomonroq. Buni qayd etmasangiz, ikkinchi darajali mezon boʻyicha yaxshilanish asosiy mezon boʻyicha yomonlashuvni yashirib qoʻyishi mumkin.
Mezonni qanday ifodalash kerak
Yaxshi mezonni bahslashmasdan tekshirish mumkin. «Javob foydali» — yomon mezon: ikki kishi uni turlicha baholaydi. «Javobda savoldagi hudud uchun bilimlar bazasidagi yetkazib berish muddati koʻrsatilgan» — yaxshi mezon: uni manba boʻyicha tekshirish mumkin. Mezonni shunday ifodalab boʻlmasa, uni bir nechta torroq mezonga ajrating yoki u uchun odamlarning ekspert bahosi kerakligini tan oling.
Baholash toʻplamini qanday yigʻish
Qoʻlda belgilash va koʻrib chiqishga qurbingiz yetadigan kichik toʻplamdan boshlab, uni asta-sekin kengaytirgan maʼqul. Misollar soni emas, ularning xilma-xilligi va halolligi muhimroq.
- Foydalanuvchilarning real soʻrovlari — loglar yoki pilotdan olingan, shaxsiy maʼlumotlardan tozalangan.
- Funksiya aynan ular uchun yaratilgan odatiy ssenariylar.
- Chekka holatlar: boʻsh kiritish, juda uzun matn, tillar aralashuvi, imlo xatolari, ikki maʼnoli ifodalar.
- Toʻgʻri javobi rad etish yoki «bilmayman» boʻlgan savollar.
- Funksiyani buzishga urinishlar: koʻrsatmalarni eʼtiborsiz qoldirish, rol doirasidan chiqish, tizim promptini oshkor qilish soʻrovlari.
- Prodakshenda topilgan har bir xato: takrorlanmasligi uchun u yangi misolga aylanadi.
Har bir misol uchun yaxshi javob nima ekanligi yoziladi: etalon, majburiy faktlar roʻyxati yoki qoidalar toʻplami. Agar yaxshi javob yomonidan nimasi bilan farq qilishini oʻzingiz ifodalay olmasangiz, buni siz uchun hech qanday avtomatika hal qilmaydi.
Toʻplamni qismlarga ajratish foydali: odatiy trafikni aks ettiruvchi asosiy qism va alohida kesimlar — tillar, soʻrov turlari, murakkab holatlar boʻyicha. Shunda bitta kesimdagi yomonlashuv umumiy oʻrtachada yoʻqolib ketmaydi. Promptni sozlashda foydalanmaydigan kichik qismni alohida saqlang — aks holda funksiyani oʻz toʻplamingizga moslab qoʻyish xavfi bor.
Etalonlarni belgilash
Etalonlarni yozma yoʻriqnoma asosida predmet sohasini tushunadigan odamlar belgilashi kerak. Belgilovchi bitta boʻlsa ham yoʻriqnoma kerak: vaqt oʻtib, javobni nega toʻgʻri deb hisoblaganingizni oʻzingiz unutasiz. Bahsli misollarni oʻchirib tashlamang — ularni muhokama qilib, qarorni yoʻriqnomaga yozish foydali, chunki keyinchalik funksiya ham, hakam ham aynan ularda xato qiladi. Etalonlar ham eskiradi: bilimlar bazasi yoki mahsulot qoidalari oʻzgarganda ularni qayta koʻrib chiqish kerak.
Shartli misol
Aytaylik, funksiya ichki bilimlar bazasi asosida mijozlarning yetkazib berish shartlari haqidagi savollariga javob beradi. Toʻplamga muddatlar va narx haqidagi tez-tez beriladigan savollar, imlo xatoli va ikki tildagi savollar, bazada yoʻq narsalar haqidagi savollar — masalan, xizmat koʻrsatilmaydigan hududga yetkazib berish haqida — va botni chegirma vaʼda qilishga majburlash urinishlari kiradi. Har biri uchun bilimlar bazasidagi majburiy faktlar va qoida yoziladi: manbada yoʻq vaʼdalar boʻlmasin.
Tekshiruv turlari va qachon qaysi birini tanlash
Kod bilan tekshiruvlar
Determinatsiyalangan tarzda tekshirib boʻladigan hamma narsani kod bilan tekshiring: JSON toʻgʻrimi va sxemaga mosmi, majburiy maydonlar bormi, uzunlik oshib ketmaganmi, ajratib olingan qiymat etalonga mos keladimi, taqiqlangan soʻzlar yoʻqmi, javob tili savol tiliga mosmi. Javob kesilmaganini alohida tekshiring: limit tufayli uzilib qolgan javob muvaffaqiyatli boʻlib kelishi va natijani jimgina buzishi mumkin.
Etalon bilan solishtirish
Tasniflash va maʼlumot ajratib olish vazifalarida javobni toʻgʻrisi bilan bevosita solishtirib, mos kelishlar ulushini hisoblash mumkin. Erkin matn uchun satrlarni solishtirish ishlamaydi: ikkita toʻgʻri javobda umumiy soʻz boʻlmasligi mumkin. Bu yerda hakam yoki inson kerak.
Hakam-model
LLM-as-judge rasmiylashtirish qiyin boʻlgan narsalarni baholaydi: toʻliqlik, manbadagi faktlarga sodiqlik, ohang, koʻrsatmaga amal qilish. Bu tez va masshtablanadi, lekin quyida aytiladigan sozlash va kalibrlashni talab qiladi.
Odamlar
Odamlar har bir ishga tushirish uchun emas, hakamni kalibrlash, eng masʼuliyatli qarorlar va bahsli holatlarni tahlil qilish uchun kerak. Odamlar tomonidan belgilash qimmat, shuning uchun uni usiz iloji yoʻq joyda sarflagan maʼqul.
- Mezonni qoida bilan ifodalash mumkin boʻlsa — koddan foydalaning, chunki u tez, arzon va barqaror.
- Yagona toʻgʻri javob boʻlsa — etalon bilan solishtiring, chunki hakam bu yerda faqat shovqin qoʻshadi.
- Mezon maʼnoviy boʻlib, javoblar koʻp boʻlishi mumkin boʻlsa — hakamdan foydalaning, lekin odamlar boʻyicha kalibrlanganidan.
- Qaror qimmat boʻlsa — masalan, masʼuliyatli funksiyada boshqa modelga oʻtish — tanlanma boʻyicha qoʻlda tekshiruv qoʻshing, chunki xato narxi xarajatni oqlaydi.
Koʻp bosqichli va agentli funksiyalar
Agar funksiya shunchaki matn bilan javob bermasa, balki harakatlar zanjirini bajarsa — qidirsa, vositalarni chaqirsa, tizimdagi maydonlarni toʻldirsa — natijani ham, yoʻlni ham baholash kerak. Natija yakuniy holat boʻyicha tekshiriladi: kartochka toʻgʻri toʻldirilganmi, kerakli yozuv yaratilganmi. Yoʻl — qadamlar jurnali boʻyicha: ortiqcha yoki xavfli vositalar chaqirilmaganmi, sikl yuzaga kelmaganmi, funksiya oqilona qadamlar soniga sigʻdimi. Toʻgʻri natijaga taqiqlangan harakat orqali kelgan funksiya baholashdan oʻtmaydi.
LLM-as-judge ni qanday sozlash
Hakam ham oʻz promptiga ega LLM funksiyasi va uning sifati boshqa har qanday funksiya kabi vazifa qoʻyilishiga bogʻliq. Bir nechta amaliyot baholarning ishonchliligini sezilarli oshiradi.
- Bitta hakam — bitta mezon. Tor hakam osonroq kalibrlanadi, uning xatolarini tushunish ham osonroq. «Javob sifatini baholang» degan umumiy hakam hammasini aralashtiradi va uning bahosidan aynan nima yomonlashganini tushunib boʻlmaydi.
- Shkalalar oʻrniga ikkilik savollar. «Javob faqat uzatilgan hujjatga tayanadimi — ha yoki yoʻq» savoli «sodiqlikni 1 dan 10 gacha baholang»dan barqarorroq.
- Aniq rubrika. Nima «ha», nima «yoʻq» hisoblanishini chegaraviy holatlar misollari bilan tasvirlang.
- Soʻrovda etalon yoki manba. Hakam faktlarga sodiqlikni faqat nima bilan solishtirishni koʻrsa tekshira oladi.
- Avval izoh, keyin baho. Hakamdan qarorini qisqacha asoslashni soʻrang va bu asosni saqlang: odamlar bilan farqlarni tahlil qilishda u hakam qaysi mezonni notoʻgʻri tushunganini koʻrsatadi.
- Hakamning qatʼiy modeli va parametrlari. Hakamning almashishi shkalani oʻzgartiradi va oldingi hamda keyingi natijalarni bevosita solishtirib boʻlmaydi.
LLM-as-judge tuzoqlari
Hakam-model qulay, lekin uning tizimli ogʻishlari bor. Ular haqida bilmasangiz, kerak boʻlmagan narsani ishonch bilan oʻlchaysiz.
- Joylashuv boʻyicha ogʻish: ikki javobni solishtirishda hakam mazmunidan qatʼi nazar birinchisini yoki ikkinchisini afzal koʻrishi mumkin. Ikkala tartibda ishga tushirish va faqat mos kelgan qarorlarni hisobga olish bilan davolanadi.
- Uzun javoblarga moyillik: batafsil javob, unda suv yoki xato koʻproq boʻlsa ham, «yaxshiroq» koʻrinadi. Qisqalikning aniq mezoni va faktlar roʻyxati boʻyicha toʻliqlikni tekshirish bilan davolanadi.
- Oʻz uslubini afzal koʻrish: hakam oʻzi yozadiganiga oʻxshash javoblarga baholarni oshirishi mumkin. Bu ayniqsa hakam va baholanayotgan funksiya oʻxshash modellarda ishlaganda muhim.
- Toʻgʻrilik oʻrniga ishonchli ohang: ishonarli ifodalangan javob ehtiyotkor, lekin toʻgʻri javobdan yuqoriroq baho olishi mumkin.
- Faktlardagi xatolar: manba yoki etalonsiz hakam haqiqatni emas, ishonarlilikni tekshiradi.
- Beqarorlik: bir xil javob qayta baholanganda turli baho olishi mumkin. Versiyalarni solishtirishga ishonishdan oldin buni bir nechta takrorda tekshiring.
Alohida tuzoq — etalonning sizib chiqishi. Agar baholash toʻplamidagi misollar funksiya promptiga namuna sifatida tushib qolsa, funksiya aynan ulardan yaxshi oʻtadi, yangi savollarda esa yomonroq ishlaydi. Prompt uzoq vaqt bir xil misollarda sozlanganda ham shunday boʻladi. Sozlashda ishlatilmaydigan nazorat qismi bunday oʻz-oʻzini aldashdan himoya qiladi.
Hakamni odamlar baholari boʻyicha kalibrlash
- 01Toʻplamdan misollarning bir qismini, jumladan chegaraviy va murakkab holatlarni tanlang.
- 02Vazifani tushunadigan odamlardan ularni hakam bilan bir xil mezon va bir xil rubrika boʻyicha belgilashni soʻrang. Belgilovchilar bir nechta boʻlsa, avval ular oʻzaro kelishadimi, tekshiring.
- 03Bu misollarda hakamni ishga tushiring.
- 04Hakam va odamlar javoblarini har bir misol boʻyicha solishtiring va farqlarni yozib chiqing.
- 05Farq boʻlgan holatlarda hakam asoslarini oʻqing: koʻpincha muammo modelda emas, noaniq rubrikada boʻladi.
- 06Rubrikani aniqlashtiring, chegaraviy holatlar misollarini qoʻshing va solishtirishni takrorlang.
- 07Hakam modeli almashganda va funksiya sezilarli oʻzgarganda kalibrlashni takrorlang.
Agar odamlar oʻzaro hakam bilan boʻlgani kabi kuchli farq qilsa, muammo mezonning oʻzida: u yetarlicha aniqlanmagan. Avval nimani yaxshi javob deb hisoblash haqida kelishib oling va shundan keyingina baholashni avtomatlashtiring.
Model yoki prompt almashganda regressiyalar
Modelning yangi versiyasi yoki promptdagi tuzatish oʻrtacha natijani yaxshilab, ayni paytda alohida muhim ssenariylarni buzishi mumkin. Shuning uchun faqat yakuniy raqamga emas, avval oʻtgan, endi esa oʻtmayotgan misollar roʻyxatiga ham qarash kerak.
- Har bir ishga tushirish natijalari bilan birga model versiyasi, prompt va parametrlarni qayd eting.
- Har qanday oʻzgarishda butun toʻplamni ishga tushiring: model, prompt, qidiruv, keyingi ishlov, kutubxona versiyasi.
- Determinatsiyalanmaganlik tufayli bahsli misollarda bitta emas, bir nechta ishga tushirish qiling.
- Natijalarni misollar boʻyicha solishtiring va har bir yomonlashuvni qoʻlda tahlil qiling.
- Kesimlarga alohida qarang: bitta til yoki soʻrov turidagi yomonlashuv oʻrtachada yashirinib qolishi mumkin.
- Faqat sifatni emas, kechikish, narx, rad etishlar va kesilgan javoblar ulushini ham tekshiring.
Qayta ifodalashga chidamlilikni alohida tekshirish kerak: turli soʻzlar bilan berilgan bitta savol solishtirsa boʻladigan javob berishi lozim. Agar sifat ifodaga qarab keskin oʻzgarsa, funksiya vazifani tushunishga emas, omadli tasodifga tayanadi. Agar bitta versiyaning ikki ishga tushirilishi sezilarli farq qilsa, avval shu shovqin bilan shugʻullaning, aks holda versiyalarni solishtirish hech narsa koʻrsatmaydi.
Solishtirish hisobotini qanday oʻqish
Yakuniy raqamdan emas, asosiy mezonlar boʻyicha «oʻtdi»dan «oʻtmadi»ga oʻtgan misollar roʻyxatidan boshlang. Har bir bunday misolni ochib, ikkala javobni oʻqish kerak: baʼzan yomonlashuv — hakam xatosi, baʼzan — haqiqiy yoʻqotish, baʼzan — eskirgan etalon. Keyin kesimlarga, faqat shundan soʻng oʻrtachaga qarang. Yaxshilanishlarni ham tanlab tekshirish kerak: kutilmaganda katta oʻsish koʻpincha tekshiruvning oʻzidagi xatoni anglatadi.
Ishlab chiqish jarayonidagi evals
Baholash toʻplami uni muntazam va qoidalar boʻyicha ishga tushirgandagina foyda beradi. Aks holda u eskiradi va hech kim takrorlamaydigan bir martalik tekshiruvga aylanadi.
- 01Toʻplamni funksiya kodi yonida, repozitoriyda versiyalar va oʻzgarishlar tarixi bilan saqlang.
- 02Kod bilan tezkor tekshiruvlarni har bir oʻzgarishda, hakam bilan toʻliq ishga tushirishni esa prompt, model yoki qidiruvdagi oʻzgarishlarni birlashtirishdan oldin bajaring.
- 03Solishtirish hisobotini shakllantiring: har bir mezon va kesim boʻyicha natija, yomonlashgan va yaxshilangan misollar roʻyxati.
- 04Qoida boʻyicha kelishib oling: asosiy mezonlar boʻyicha misollar yomonlashgan boʻlsa, yomonlashuvlar tahlil qilinmaguncha oʻzgarish birlashtirilmaydi.
- 05Toʻplamni qayta koʻrib chiqing: eskirgan misollarni olib tashlang, yangi ssenariylar va prodakshendagi xatolarni qoʻshing.
Hakam bilan ishga tushirish pul va vaqt talab qiladi, shuning uchun uni har bir commitda ishga tushirish shart emas. Toʻplamni tezkor va toʻliq qismlarga ajratish oqilona: kod tekshiruvlari va oz sonli asosiy misollardan iborat tezkori — har bir oʻzgarishda, toʻligʻi — muhim oʻzgarishlarni birlashtirishdan oldin va jadval boʻyicha. Oʻzgarishsiz takroriy ishga tushirish uchun pul toʻlamaslik uchun funksiya javoblari va hakam baholarini prompt va model versiyasi boʻyicha keshlash mumkin.
Solishtirishning shartli misoli
Jamoa javoblar qisqaroq boʻlishi uchun yetkazib berish haqidagi javoblar funksiyasining promptini oʻzgartiradi. Hisobot oʻrtacha uzunlik kamayganini, manbaga sodiqlik oʻzgarmaganini, lekin bir nechta misolda uzoq hududlar uchun muddatlar haqidagi majburiy eslatma yoʻqolganini koʻrsatadi. Misollar boʻyicha solishtirmasdan bu sezilmay qolardi — toʻliqlik boʻyicha oʻrtacha deyarli oʻzgarmagan.
Chiqarilgandan keyin
Chiqarilgandan keyin sifat real trafikda kuzatib boriladi: foydalanuvchilar fikri yigʻiladi, javoblar kod, hakam va odamlar tomonidan tanlab tekshiriladi, rad etishlar va kesilgan javoblar ulushi kuzatiladi. Topilgan muvaffaqiyatsizliklar baholash toʻplamiga koʻchiriladi. Shunday qilib, toʻplam mahsulot bilan birga oʻsadi va foydalanuvchilarda haqiqatan nima boʻlayotganini aks ettiradi.
Nazorat roʻyxati: funksiyangiz uchun evals
- 01«Sifat»ni alohida mezonlarga ajrating va ularni muhimlik boʻyicha tartiblang.
- 02Real soʻrovlar va chekka holatlardan kichik, xilma-xil misollar toʻplamini yigʻing.
- 03Har bir misol uchun yaxshi javob nima ekanini yozing.
- 04Toʻgʻri javobi rad etish boʻlgan savollarni qoʻshing.
- 05Toʻplamni kesimlarga ajrating va nazorat qismini alohida qoʻying.
- 06Rasmiylashtirib boʻladigan hamma narsani, jumladan format va kesilgan javoblarni, kod bilan tekshiring.
- 07Qolgani uchun ikkilik mezonli va rubrikali tor hakamlarni sozlang.
- 08Hakamlarni qoʻlda belgilangan maʼlumotlar boʻyicha kalibrlang va ular almashganda kalibrlashni takrorlang.
- 09Baholar barqarorligini takroriy ishga tushirishlarda tekshiring.
- 10Toʻplamni ishga tushirishni jarayonga kiriting: usiz model yoki prompt almashtirilmaydi.
- 11Natijalarni versiyalar bilan saqlang va misollar hamda kesimlar boʻyicha solishtiring.
- 12Sifat bilan birga kechikish, narx va rad etishlar ulushini kuzating.
- 13Toʻplamni prodakshendagi har bir xato bilan toʻldirib boring.
Atamalarning qisqa lugʻati
- Evals — LLM funksiyasi baholanadigan mezonli misollar toʻplami.
- Etalon — oldindan tayyorlangan toʻgʻri javob yoki javobning majburiy elementlari roʻyxati.
- LLM-as-judge — javoblarni berilgan mezon boʻyicha baholash uchun til modelidan foydalanish.
- Rubrika — qaysi javob mezonga mos deb hisoblanishining misollar bilan tavsifi.
- Kalibrlash — hakam baholarini odamlar baholari bilan solishtirish va mezonlarni aniqlashtirish.
- Regressiya — avval oʻtgan misollardagi yomonlashuv.
- Kesim — toʻplamning til, soʻrov turi, murakkablik kabi belgi boʻyicha ajratilgan qismi.
Xulosa
LLM sifatini baholash — bir martalik tekshiruv emas, muhandislik amaliyoti. Mezonlari aniq misollar toʻplami, imkon boʻlgan joyda kod bilan tekshiruvlar, imkon boʻlmagan joyda kalibrlangan hakam va har bir oʻzgarishda misollar boʻyicha solishtirish — modellar va promptlarni qoʻrquvsiz almashtirish imkonini aynan shu beradi.
Bunday toʻplam loyihada qanchalik erta paydo boʻlsa, har bir keyingi yaxshilanish shunchalik arzonga tushadi. Kichikdan — halol misollarning kichik toʻplami va bir nechta kod tekshiruvidan — boshlang va toʻplamni mahsulot bilan birga oʻstiring.
Koʻp beriladigan savollar
Bu LLM funksiyasi orqali avtomatik ishga tushiriladigan, yaxshi javob mezonlari belgilangan qatʼiy misollar toʻplami. U model, prompt yoki muhit oʻzgargandan keyin sifat yaxshilangan yoki yomonlashganini koʻrsatadi.
Faqat misollarning bir qismida odamlar baholari bilan solishtirilgandan keyin. Hakamning tizimli ogʻishlari bor — joylashuv, uzunlik, oʻz uslubi boʻyicha — va ularni mezonlarni qoʻyishda hisobga olish kerak.
Ikkalasida bir xil mezonli bitta baholash toʻplamini ishga tushirib, natijalarni faqat oʻrtacha ball boʻyicha emas, har bir misol va kesim boʻyicha solishtirish kerak. Kechikish, narx va rad etishlar ulushini alohida solishtiring.
Universal raqam yoʻq. Qoʻlda belgilab, tekshira oladigan toʻplamdan boshlang va uni real soʻrovlar hamda topilgan xatolar hisobiga kengaytiring.
Tamoyil bir xil — har bir oʻzgarishda qatʼiy tekshiruvlar, — lekin toʻgʻri javob koʻpincha yagona emas, model natijasi esa determinatsiyalanmagan. Shuning uchun aniq solishtirish oʻrniga mezonlar, hakamlar va bir nechta ishga tushirishdan foydalaniladi.
Kod bilan tezkor tekshiruvlar — har bir oʻzgarishda, hakam bilan toʻliq ishga tushirish — prompt, model yoki qidiruvdagi har qanday oʻzgarishdan oldin. Chiqarilgandan keyin sifat real trafikda doimiy kuzatiladi.