Yapay zeka ajan liderlik tablolari, sekildeki en yetenekli yapay zeka modellerini siralamak icin yaygin sekilde kullaniliyor. Ancak yeni bir arastirma, bu tablolarin guvenilirligini ciddi sekilde sorguluyor. DAIR.AI’nin paylastigi arastirmaya gore, ajan liderlik tablolarinin olctugu sey aslinda yetenek degil uzmanlasma olabilir.
Arastirmanin Temel Bulgulari
Generalizability Theory cercevesinde gerceklestirilen bu calismada, uc farkli acik ajan-iz benchmark’i (TheAgentCompany, tau-bench ve AppWorld) incelendi. Bulgular sasirticiydi: ajan ana etkisi, her veri setinde ve her kontrol turunde toplam varyansin yuzde 3’inden azini aciklıyordu. Buna karsilik ajan-gorev etkilesimi yuzde 7 ile yuzde 23 arasinda bir paya sahipti.
Liderlik Tablolari Neden Yaniltici Olabilir?
Arastirmacilar, dort temel bulguya dikkat cekiyor:
- Guvenilirlik Coksu: En zor gorev cerenginde, tau aksiyon kontrollerinde guvenilirlik 0.752’den 0.000’a dsuuyor
- Ters Korelasyon: Egitim-hucre guvenilirligi, held-out guvenilirligiyle negatif korelasyon gosteriyor (r = -0.90)
- Genellenebilir Tanilama: Populasyon duzeyindeki tanilar benchmark’lar arasinda transfer ediliyor (yetenek-bosluk orani 0.35-0.40 araliginda sabit)
- Siralama Tersine Evrilmesi: Aile bazinda ajan siralamalari tersine donuyor
Uct Farkli Tahminci Uyumu
Arastirma, Henderson Method-I, REML (lme4 araciliğiyla) ve Bayesian binomial GLMM olmak uzere uc farkli tahminci kullandi. Bu uc tahminci, uc ondalik basamaga kadar uyum sagladi ve bu da bulgularin guclu bir istatistiksel temele sahip oldugunu gosteriyor.
Deployment Decision Reliability (DDR) Tekifi
Calisma, sonuclari Deployment Decision Reliability (DDR) adli bir raporlama disiplini halinde paketliyor. Bu yaklasim, varyans bileşeni tablosunu bir kurumsal alicinini savunabilecegi bes karara donusturuyor. Tum kod, veri yukleyiciler ve fit artifact’lari acik kaynak lisansıyla yayinlandi.
Sonuc ve Degerlendirme
Arastirma, yapay zeka ajan degerlendirmesinde liderlik tablolarina gvenilirken dikkatli olunmasi gerektigini ortaya koyuyor. Mevcut tablolar, bir ajanin genel yeteneklerini degil, belirli gorev turlerindeki uzmanlasmasini yansitiyor olabilir. Bu bulgular, ozellikle kurumsal yapay zeka satin alma kararlari veren profesyoneller icin kritik oneme sahiptir.
Kaynak: Deployment Decision Reliability – arXiv:2608.11323 | @DAIR.AI – X/Twitter
Henüz yorum yok. İlk yorumu siz yapın!