CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
22 Aug 2026 · 21:14 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
AYıN TRENDLERI SAYI #1.909 22 Ağu 2026 · Cumartesi

Microsoft ‘Thinkingbox’ ile AI Ajan Güvenilirliği Haritasını Çıkardı: En Güçlü Model Yüzde 65 Başarıyor, Yüzde 25 Tekrar Edebiliyor

Microsoft Research, yapay zeka ajanlarının gerçek iş dünyasındaki güvenilirlik sorununu ölçmek için kapsamlı yeni bir benchmark yayımladı.

AiHaber Editör
Editör
3DK

★ Hızlı Özet

  • Microsoft Research, yapay zeka ajanlarının gerçek iş dünyasındaki güvenilirlik sorununu ölçmek için kapsamlı yeni bir benchmark yayımladı.
  • Sonuçlar şaşırtıcı: En güçlü modeller bile ilk denemede yalnızca yüzde 65,36 başarı oranına ulaşabiliyor.
  • Microsoft Research'ün yayımladığı yeni araştırma, iki temel bileşenden oluşuyor: Thinkingbox — AI ajanlarını gerçek iş araçlarıyla test eden…
  • Bu benchmark, diğer testlerden farklı olarak yalnızca yanıt kalitesini değil, arka uç sistemlerinde bırakılan kalıcı durumları da değerlendiriyor.

Microsoft Research, yapay zeka ajanlarının gerçek iş dünyasındaki güvenilirlik sorununu ölçmek için kapsamlı yeni bir benchmark yayımladı. Thinkingbox adı verilen sandbox ortamı ve 507 iş akışından oluşan test seti, AI ajanlarının ne denli güvenilir olduğunu — ya da olmadığını — gözler önüne seriyor.

Sonuçlar şaşırtıcı: En güçlü modeller bile ilk denemede yalnızca yüzde 65,36 başarı oranına ulaşabiliyor. AI ajan güvenilirliği konusunda bu, sektörün hâlâ çok yol kat etmesi gerektiğini gösteriyor.

Thinkingbox Nedir?

Microsoft Research’ün yayımladığı yeni araştırma, iki temel bileşenden oluşuyor: Thinkingbox — AI ajanlarını gerçek iş araçlarıyla test eden izole bir sandbox ortamı — ve Thinkingbox-bench — 507 politika koşullu iş akışını barındıran kapsamlı bir benchmark seti.

Bu benchmark, diğer testlerden farklı olarak yalnızca yanıt kalitesini değil, arka uç sistemlerinde bırakılan kalıcı durumları da değerlendiriyor. Her deneme, yalnızca doğru sonucu üretmekle kalmayıp, eksik veya fazla eylemler gerçekleştirmeme açısından da puan alıyor.

Hangi Sektörler Test Edildi?

Thinkingbox-bench beş farklı sektörde kapsamlı testler yürüttü: perakende, konaklama, otomotiv sigortacılığı, neobanka BT altyapısı ve danışmanlık destek hizmetleri. Her sektörde ajanlar, gerçek dünya koşullarına yakın görevlerle karşı karşıya bırakıldı.

Ana Bulgular: Başarı Görünüyor, Güvenilirlik Aldatıcı

Araştırmanın en dikkat çekici bulgusu şu: Başarısız denemelerin büyük çoğunluğu temiz biçimde sonlanıyor ve geçerli araç çağrıları yapıyor görünüyor. Bir ajan yanıt üretebilir, araç çağırabilir ve düzgün biçimde çıkış yapabilir — ancak görev aslında tamamlanmamıştır.

Bu durum, geliştiricilerin ajan performansını izlemek için kullandığı geleneksel sinyallerin — yanıt kalitesi, araç çağrısı başarısı, sonlanma durumu — güvenilir olmadığını ortaya koyuyor.

Gerçek Dünya İçin Ne Anlama Geliyor?

Microsoft’un bulguları, AI ajanlarının kurumsal iş yüklerinde güvenilir biçimde kullanılabilmesi için yeni değerlendirme standartları belirlenmesi gerektiğini gösteriyor. Mevcut benchmarklar çoğunlukla tek seferlik başarıyı ölçüyor; oysa gerçek iş ortamlarında ajanların görevleri tutarlı biçimde tamamlaması gerekiyor.

Araştırma ekibi, Thinkingbox ve Thinkingbox-bench’i hem araştırma topluluğuna hem de kurumsal kullanıcılara açık kaynak olarak sundu. Amaç, ajan güvenilirliğini ölçmek için daha standart ve titiz yöntemler geliştirmek.

Kaynak: @dair_ai / X, Microsoft Research / arXiv

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları