Yapay Zeka Ajan Benchmark’larında Güvenilirlik Krizi: Leaderboard Sıralamaları Kapsamlı Bir Resim Çizmiyor
Yapay zeka ajan benchmark sistemleri ciddi bir güvenilirlik kriziyle karşı karşıya. Yeni araştırma, günümüzün önde gelen yapay zeka ajan değerlendirme platformlarında sıralamaların büyük ölçüde uzmanlaşmayı yansıttığını, gerçek genel yetenekten bağımsız olduğunu ortaya koyuyor.
Genelliği Test Etmek: Üç Farklı Benchmark
Araştırmacılar, TheAgentCompany, tau-squared-bench ve AppWorld olmak üzere üç farklı yapay zeka ajan benchmark üzerinde Dört Yönlü Genişletilmiş Genellenebilirlik Teorisi (Generalizability Theory) analizi uyguladı. Sonuçlar şaşırtıcıydı: Ajan ana etkisi, tüm veri setlerinde toplam varyansın yüzde 3’ünden azını oluşturuyor. Ajan-görev etkileşimi ise yüzde 7 ile 23 arasında bir pay alıyor.
Bu bulgular, bir yapay zeka ajanın leaderboard’daki konumunun büyük ölçüde hangi görevlerde uzmanlaştığına bağlı olduğunu, saf yetenekten ziyade.
Eğitim Hücresi Güvenilirliği ve Held-Out Performans
Araştırmanın en çarpıcı bulgusu, eğitim hücresi güvenilirliği ile held-out (görülmemiş) görevlerdeki güvenilirlik arasındaki güçlü negatif korelasyon: -0.90. Bu, leaderboard’larda en güvenilir görünen tasarımların aslında görülmemiş görevlerde en kötü performansı gösterdiği anlamına geliyor.
En Zor Görevlerde Çöküş
Zorluk seviyesi arttıkça güvenilirlik endişe verici biçimde düşüyor. En zor görev çeyrekliğinde tau-squared aksiyon kontrollerinde güvenilirlik 0.752’den 0.000’a düşüyor. Bu, günümüzün en güçlü yapay zeka ajanlarının çok adımlı, bileşik görevlerde tamamen güvenilmez hale gelebileceğini gösteriyor.
Popülasyon Düzeyinde Transfer Mümkün
Tüm bu olumsuz tabloya rağmen umut ışığı da var: Yetkinlik açığı oranı (capability-gap ratio), farklı enterprise benchmark’ları arasında 0.35 ile 0.40 arasında sabit kalıyor. Yani popülasyon düzeyindeki tanılar benchmark’lar arasında aktarılabiliyor. Ancak bireysel benchmark ailelerinin sıralamaları tamamen tersinebiliyor.
Sonuç: Leaderboard’lara Şüpheyle Yaklaşmak Gerek
Bu bulgular, yapay zeka ajan benchmark değerlendirmelerinde leaderboard sıralamalarına aşırı güven edilmemesi gerektiğini açıkça ortaya koyuyor. Gerçek yetenek değerlendirmesi için birden fazla benchmark’ta ve farklı zorluk seviyelerinde kapsamlı test şart. Sadece toplam puanlara bakarak yapay zeka ajan performansı hakkında kesin yargıya varmak yanıltıcı olabilir.
Bu araştırma, DAIR.AI tarafından paylaşılmış olup orijinal çalışmaya X üzerinden erişilebilir.
Henüz yorum yok. İlk yorumu siz yapın!