AI evaluation harness, model ciktisini ölçülebilir kriterlere baglayan otomatik test altyapisidir. Geleneksel birim testleri gibi calismaz; çıktı dogasi belirsiz oldugundan eslesme, benzerlik ve yargi tabanli metrikler kullanılır. Amac tek bir skor üretmek degil, ürün kalitesini zaman icinde izlenebilir kilmaktir.
Offline ve online eval ayrimi
Offline eval, sabit bir golden dataset uzerinde çalışır. Model surumu, prompt veya retrieval degisikligi merge oncesi burada test edilir. Online eval ise üretim trafiginin bir kisminda A/B test veya shadow scoring ile yapilir. Offline hızlı geri bildirim verir; online gerçek kullanıcı dagilimini yansitir.
Hata: yalnizca offline eval ile canliya cikmak. Golden set gerçek kullanıcı sorularini temsil etmiyorsa regresyon uretimde ortaya cikar. Çözüm: üretim loglarindan haftalik orneklenmis sorulari golden set'e ekleyin ve etiketleyin.
Golden dataset oluşturma
Kaliteli golden set asgari su alanlari icerir: girdi, beklenen cevap veya kabul kriterleri, zorluk etiketi, domain etiketi. Sentetik veri ile baslayip gerçek vakalarla genisletin. Her örnek icin neden bu cevap doğru aciklamasi (rationale) tutun; anlasilmaz etiketler ekip icinde tutarsizlik yaratir.
{
"id": "eval-0421",
"input": "Iade politikasinda 30 gun kurali gecerli mi?",
"criteria": ["30 gun vurgulanmali", "istisna maddeleri belirtilmeli"],
"forbidden": ["kesin hukuki tavsiye"],
"reference_doc_ids": ["policy-v3.2"]
}
Metrik aileleri
Faithfulness (baglilik): Cevap kaynak dokumanlara dayaniyor mu? RAG sistemlerinde halusinasyon tespiti icin kritik. Answer relevance: Soruya mi cevap veriyor, genel sohbet mi? Tool correctness: Doğru arac doğru parametreyle cagrildi mi? Latency ve cost: P95 gecikme, token basina maliyet.
Is metrikleri teknik metriklerle hizalanmali. Örneğin faithfulness yüksek ama relevance dusukse kullanıcı "doğru ama ise yaramayan" cevap alir. Dashboard'da her ikisini birlikte gosterin.
LLM-as-judge kalıbı
Insan etiketlemesi pahali oldugundan ikinci bir model hakem olarak kullanılır. Rubric net olmali: 1-5 skala, her puan icin örnek cevap. Judge modeli degerlendirilen modelle ayni olmamali; aksi halde bias olusur.
Judge guvenilirligi icin ara ara insan kalibrasyonu yapin. Cohen kappa veya benzeri uyum ölçümü dusukse rubric revize edilmeli. Uretimde judge maliyeti birikir; orneklem oranini dinamik ayarlayin — düşük guven skorlu cevaplari her zaman insan veya judge'a gonderin.
Regresyon boru hattı
Her pull request'te eval harness calismali. Esik degerler: faithfulness ortalamasi önceki surumden en fazla 2 puan dusmemeli, tool error rate artmamali, latency P95 %15'i asmamali. Esik asilirsa merge bloklanir veya uyarı verilir.
Flaky eval sorunu: LLM stokastik oldugundan ayni test bazi calistirmalarda gecer bazi calistirmalarda kalir. Çözümler: sabit seed (destekleyen saglayicilarda), çoklu run ve majority vote, ve esik yerine guven araligi kullanımı.
async function runEvalSuite(modelVersion: string): Promise<EvalReport> {
const results = await Promise.all(
goldenSet.map(case => evaluateCase(case, modelVersion))
);
return {
faithfulness: mean(results.map(r => r.faith)),
regression: compareToBaseline(results, baselineVersion),
failures: results.filter(r => !r.passed)
};
}
Güvenlik ve red team eval
Kalite eval'i güvenlik eval'inden ayirin ama ayni harness altyapisinda calistirin. Prompt injection, veri cikarma ve yetki asimi senaryolari ayri test paketidir. Başarı kriteri: hassas veri sizmasi sifir, destructive tool çağrısı sifir.
Red team seti periyodik güncellenmeli; saldirgan teknikleri hizla evrilir. Otomatik mutasyon: mevcut injection orneklerine paraphrase ve encoding varyasyonlari ekleyin.
Multimodal ve ajan eval
Ajan sistemlerinde tek cevap metrigi yetersizdir. Trajectory eval kullanın: adim dizisi optimal mi, gereksiz tool çağrısı var mi, toplam maliyet kabul edilebilir mi? Başarılı gorev tamamlama orani (task success rate) en ust metrik olmalidir.
Cok adimli gorevlerde ara adim basarisizligi tolere edilebilir mi tanimlayin. Örneğin arama başarısız olsa bile alternatif kaynak denenmesi başarı sayilabilir — rubric'te açıkça yazin.
Veri gizliliği
Eval loglarinda üretim PII bulunmamali. Maskeleme pipeline'i eval harness'in parcasidir. Golden set versiyonlayin; eski set ile yeni set skorlarini karsilastirirken set degisikliginin etkisini ayirin.
Operasyonel entegrasyon
Eval sonuclarini Slack, Jira veya dahili portal ile paylasin. Basarisizlik raporunda diff gosterin: eski cevap, yeni cevap, judge gerekcesi. Muhendisler hızlı kok neden analizi yapabilmeli.
Model saglayici guncellemesi sizin kontrolunuz dışında regresyon getirebilir. Sürüm pinleme ve saglayici eval tetikleyicisi kurun. Ayrica kendi eval setinizle üçüncü taraf benchmark'lara (MMLU vb.) körü körüne guvenmeyin; domain spesifik set daha anlamlidir.
Maliyet optimizasyonu
Tam golden set her commit'te pahali olabilir. Katmanli strateji: smoke subset her commit, tam set gece, geniş güvenlik seti haftalik. Önemli degisikliklerde tam set zorunlu.
Cache edilmis retrieval sonuclari ile eval calistirmak tutarlılığı artirir; ancak retrieval degisikligini test etmiyorsaniz yaniltici olabilir. Retrieval eval modunu ayri bayrakla acin.
Olgunluk modeli
Baslangic: manuel örnek kontrol. Orta: otomatik golden set + faithfulness. Ileri: online eval, trajectory metrikleri, otomatik rollback. Evaluation harness olgunlastikca model degisikligi korkusu azalir ve release hizi artar.
Kaliteyi olcmek, kaliteyi varsaymaktan uc kat daha pahatidir — ama olcmeyen ekipler üretim olaylarini ölçüm olarak kullanır. Harness tabanli eval, AI urunlerinde sürdürülebilir kalite kulturunun temelidir.
Ek derinlemesine notlar
Üretim ortamlarinda bu konunun pratik etkisi çoğu zaman dokumantasyondaki teorik anlatimdan farklı seyler cikar. Ekipler ilk deploy sonrasinda gerçek trafik altinda gecikme dagiliminin staging ortamindaki tahminlerden sapabildigini görür. Bu nedenle metrikleri erken tasmak ve esik degerleri gerçek veriye gore kalibre etmek kritik oneme sahiptir.
Operasyonel olgunluk, hata oranini sifira indirmekten ziyade hatalari hızlı tespit edip sinirli etki alaniyla izole edebilmektir. Canary release, feature flag ve otomatik rollback mekanizmalarini harness ve eval katmanlariyla birlikte düşünmek gerekir. Aksi halde model veya indeks guncellemesi tüm kullanıcıları ayni anda etkiler.
Capraz fonksiyonel sahiplik de başarı icin sarttir. Platform muhendisligi altyapiyi, ML ekibi modeli, ürün ekibi deneyimi, güvenlik ekibi politika ve denetimi sahiplenmelidir. Tek bir "AI ekibi" hepsini tasimaya calistiginda bilgi silolari ve gecikmeler olusur. RFC süreci ile mimari kararlar kayıt altina alinmali; "neden RAG yerine fine-tune sectik" sorusunun cevabi alti ay sonra hala bulunabilmelidir.
Son olarak maliyet ve kalite dengesi statik degildir. Saglayici fiyatlandirmasi, yeni model aileleri ve hardware gelismeleri uc ayda bir dengeyi degistirebilir. Üretim yiginini periyodik olarak yeniden degerlendirmek — gereksiz katmanı kapatmak, cache stratejisini guncellemek, daha küçük ama yeterli modele gecmek — sürdürülebilir operasyonun parcasidir.
Ek derinlemesine notlar
Üretim ortamlarinda bu konunun pratik etkisi çoğu zaman dokumantasyondaki teorik anlatimdan farklı seyler cikar. Ekipler ilk deploy sonrasinda gerçek trafik altinda gecikme dagiliminin staging ortamindaki tahminlerden sapabildigini görür. Bu nedenle metrikleri erken tasmak ve esik degerleri gerçek veriye gore kalibre etmek kritik oneme sahiptir.
Operasyonel olgunluk, hata oranini sifira indirmekten ziyade hatalari hızlı tespit edip sinirli etki alaniyla izole edebilmektir. Canary release, feature flag ve otomatik rollback mekanizmalarini harness ve eval katmanlariyla birlikte düşünmek gerekir. Aksi halde model veya indeks guncellemesi tüm kullanıcıları ayni anda etkiler.
Capraz fonksiyonel sahiplik de başarı icin sarttir. Platform muhendisligi altyapiyi, ML ekibi modeli, ürün ekibi deneyimi, güvenlik ekibi politika ve denetimi sahiplenmelidir. Tek bir "AI ekibi" hepsini tasimaya calistiginda bilgi silolari ve gecikmeler olusur. RFC süreci ile mimari kararlar kayıt altina alinmali; "neden RAG yerine fine-tune sectik" sorusunun cevabi alti ay sonra hala bulunabilmelidir.
Son olarak maliyet ve kalite dengesi statik degildir. Saglayici fiyatlandirmasi, yeni model aileleri ve hardware gelismeleri uc ayda bir dengeyi degistirebilir. Üretim yiginini periyodik olarak yeniden degerlendirmek — gereksiz katmanı kapatmak, cache stratejisini guncellemek, daha küçük ama yeterli modele gecmek — sürdürülebilir operasyonun parcasidir.