Microsoft, yapay zeka ajanlarinin guvenilirlik sorununu ortaya koyan yeni bir arac tanitti. Microsoft ThinkingBox adli bu sandbox sistemi, AI ajanlarinin gercek is senaryolarinda ne kadar guvenilir calistigini objektif olarak olcuyor. Arastirma sonuclari, en iyi AI ajanlarinin gorevlerin yuzde 91’ini en az bir kez basariyla tamamladigini, ancak ayni gorevleri her seferinde basariyla yerine getirme oraninin yalnizca yuzde 25 oldugunu gosteriyor.
AI Ajanlar Neden Her Defasinda Basarili Olamiyor?
Geleneksel AI degerlendirme yontemleri, bir ajanin bir gorevi bir kez basariyla tamamlamasina odaklaniyor. Ancak Microsoft ThinkingBox arastirmasi, gercek dunyada basarinin yalnizca bir kez olcumenin yaniltici olabilecegini ortaya koyuyor. Ajanlar bir kez basarili olabilir, ancak ayni kosullar altinda ayni sonucu tekrarlayamayabilir.
Arastirmacilara gore basarisiz calisan ajanlarin yuzde 80’i disaridan bakildiginda basarili gorunuyor. Ajan veritabanina yazan bir arac cagirir, islem tamamlandi mesaji dondurur ancak kayitlar eksik veya hatali olabilir. Ajan isin bittigini soylerken, sistem kayitlari aksini gosteriyor.
ThinkingBox Benchmark: 507 Gercek Is Senaryosu
Microsoft ThinkingBox-bench, perakende, konaklama, oto sigorta, neobanka IT, danismanlik IT ve HR destek gibi cesitli alanlarda 507 politika kosullu is akisi iceriyor. Her deneme, gecerli yorungeleri kabul ederken yanlis, eksik veya fazla etkileri reddeden gorev-ozel yurutulebilir kontrollerle degerlendiriliyor.
Sonuclar endise verici: En guclu model yuzde 65.36 pass@1 elde ederken, ayni model yuzde 25.25 pass@20 skoruna dustu. Bu, yapay zeka ajanlarinin zaman zaman dogru cevap uretmesinin, her zaman guvenilir sekilde calistigi anlamina gelmedigini gosteriyor.
AI Ajan Testlerinde Devrim Niteliginde Yenilik
Microsoft’in bu calismasi, AI ajan degerlendirmesinde yeni bir cagri niteligi tasiyor. Geleneksel yontemler yanit seviyesinde veya arac cagirisi seviyesinde kontrol yapiyor. Ancak ThinkingBox, veritabani durumunu sonrasinda kontrol ederek uctan uca gorevi tamamlama basarisini olcuyor.
Bu yaklasim, ornegin bir musteri siparisinin gercekten veritabanina islenip islenmedigini veya bir sigorta talebinin dogru sekilde kaydedilip kaydedilmedigini kontrol ediyor. Ajanin verdigi yanit degil, arkautaki veri durumu degerlendiriliyor.
Sonuc: Tek Basari Gercel Guvenilirligi Garanti Etmiyor
Microsoft’in arastirmasi, AI ajanlarinin gelecegi acisindan kritik bir uyari iceriyor. Bir ajanin bir kez basarili olmasi, her zaman basarili olacagi anlamina gelmiyor. Is dunyasinda kullanilan AI ajanlarindan gercek guvenilirlik beklemek icin pass@20 gibi coklu calistirma metriklerine bakmak gerekiyor.
GitHub: https://github.com/microsoft/thinkingbox | Arxiv: arxiv.org/abs/2608.19741
Kaynak: @rohanpaul_ai / X
Henüz yorum yok. İlk yorumu siz yapın!