Microsoft Research, yapay zeka ajanlarının gerçek iş dünyasındaki güvenilirlik sorununu ölçmek için kapsamlı yeni bir benchmark yayımladı. Thinkingbox adı verilen sandbox ortamı ve 507 iş akışından oluşan test seti, AI ajanlarının ne denli güvenilir olduğunu — ya da olmadığını — gözler önüne seriyor.
Sonuçlar şaşırtıcı: En güçlü modeller bile ilk denemede yalnızca yüzde 65,36 başarı oranına ulaşabiliyor. AI ajan güvenilirliği konusunda bu, sektörün hâlâ çok yol kat etmesi gerektiğini gösteriyor.
Thinkingbox Nedir?
Microsoft Research’ün yayımladığı yeni araştırma, iki temel bileşenden oluşuyor: Thinkingbox — AI ajanlarını gerçek iş araçlarıyla test eden izole bir sandbox ortamı — ve Thinkingbox-bench — 507 politika koşullu iş akışını barındıran kapsamlı bir benchmark seti.
Bu benchmark, diğer testlerden farklı olarak yalnızca yanıt kalitesini değil, arka uç sistemlerinde bırakılan kalıcı durumları da değerlendiriyor. Her deneme, yalnızca doğru sonucu üretmekle kalmayıp, eksik veya fazla eylemler gerçekleştirmeme açısından da puan alıyor.
Hangi Sektörler Test Edildi?
Thinkingbox-bench beş farklı sektörde kapsamlı testler yürüttü: perakende, konaklama, otomotiv sigortacılığı, neobanka BT altyapısı ve danışmanlık destek hizmetleri. Her sektörde ajanlar, gerçek dünya koşullarına yakın görevlerle karşı karşıya bırakıldı.
Ana Bulgular: Başarı Görünüyor, Güvenilirlik Aldatıcı
Araştırmanın en dikkat çekici bulgusu şu: Başarısız denemelerin büyük çoğunluğu temiz biçimde sonlanıyor ve geçerli araç çağrıları yapıyor görünüyor. Bir ajan yanıt üretebilir, araç çağırabilir ve düzgün biçimde çıkış yapabilir — ancak görev aslında tamamlanmamıştır.
Bu durum, geliştiricilerin ajan performansını izlemek için kullandığı geleneksel sinyallerin — yanıt kalitesi, araç çağrısı başarısı, sonlanma durumu — güvenilir olmadığını ortaya koyuyor.
Gerçek Dünya İçin Ne Anlama Geliyor?
Microsoft’un bulguları, AI ajanlarının kurumsal iş yüklerinde güvenilir biçimde kullanılabilmesi için yeni değerlendirme standartları belirlenmesi gerektiğini gösteriyor. Mevcut benchmarklar çoğunlukla tek seferlik başarıyı ölçüyor; oysa gerçek iş ortamlarında ajanların görevleri tutarlı biçimde tamamlaması gerekiyor.
Araştırma ekibi, Thinkingbox ve Thinkingbox-bench’i hem araştırma topluluğuna hem de kurumsal kullanıcılara açık kaynak olarak sundu. Amaç, ajan güvenilirliğini ölçmek için daha standart ve titiz yöntemler geliştirmek.
Kaynak: @dair_ai / X, Microsoft Research / arXiv
Henüz yorum yok. İlk yorumu siz yapın!