DAIR.AI’nin yayimladigi yeni bir arastirma, yapay zeka ajan siralama tablolarinin gosterdigi kadar güvenilir olmadigini ortaya koydu. Yapilan kapsamli analiz, siralamalarin büyük ölcüde uzmanlasa attigini ve gercek genel performansı yansitmadigini gosteriyor.

Siralamalar Neden Yaniltici?
TheAgentCompany, tau-squared-bench ve AppWorld uzerinde yapilan dort yonlu Genelizabilirlik Teorisi analizi, ajan ana etkisinin her veri setinde toplam varyansin yüzde 3’inden azini acikladigini gosterdi. Ajan-gorev etkilesimi ise yüzde 7 ila 23 arasinda degisiyor.
Bu bulgular, mevcut yapay zeka ajan siralamalarinin aslinda belirli gorevlerdeki uzmanligi yansittigini, genel performansi degil. Kullanici bir ajanı secerken siralama tablolarina bakmak yerine, kendi spesifik gorevlerindeki basarisini test etmeli.
Guvenilirlik Sorunu: Egitim ve Held-Out Performans Farki
Arastirmada en dikkat cekici bulgu, egitim hucre guvenilirliginin held-out guvenilirlikle eksi 0.90 ile negatif korelasyon gostermesi oldu. Bu, en guvenilir gorunen tasarimlerin gercek dunyada en kotu sonuclar verdigi anlamina geliyor.
Tau-squared aksiyon kontrollerinde, en zor gorev ceyreginde guvenilirlik 0.752’den 0.000’a dustu. Bu muazzam düsüs, siralama tablolarinin en zorlu senaryolarda hicbir prediction degeri sunmadigini gosteriyor.
Popülasyon Düzeyinde Transfer mümkün mü?
Arastirmaci, popülasyon düzeyinde tanilama yontemlerinin kurumsal benchmark’larda 0.35-0.40 arasinda sabit yetenek-gacigi oraniyla transfer oldugunu buldu. Ancak aile bazinda siralamalar tersine dönüyor.
Bu bulgular, yapay zeka ajan degerlendirmesi icin yeni yontemlerin gerektigini ortaya koyuyor. Siralama tablolari yerine, spesifik gorevlerdeki basaris oranlari ve gercek dunya performansi on planda tutulmali.
Ilgili: xAI Grok 4.6 Frontier Yapay Zeka Modellleri
Kaynak: DAIR.AI (@dair_ai)
Henüz yorum yok. İlk yorumu siz yapın!