CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
23 Aug 2026 · 23:15 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #1.977 23 Ağu 2026 · Pazar

Microsoft ThinkingBox: AI Ajanlarda Güvenilirlik Krizi

Microsoft, yapay zeka ajanlarinin guvenilirlik sorununu ortaya koyan yeni bir arac tanitti.

AiHaber Editör
Editör
2DK 8OKUMA

★ Hızlı Özet

  • Microsoft, yapay zeka ajanlarinin guvenilirlik sorununu ortaya koyan yeni bir arac tanitti.
  • AI Ajanlar Neden Her Defasinda Basarili Olamiyor?
  • Arastirmacilara gore basarisiz calisan ajanlarin yuzde 80'i disaridan bakildiginda basarili gorunuyor.
  • ThinkingBox Benchmark: 507 Gercek Is Senaryosu Microsoft ThinkingBox-bench, perakende, konaklama, oto sigorta, neobanka IT, danismanlik IT v…

Microsoft, yapay zeka ajanlarinin guvenilirlik sorununu ortaya koyan yeni bir arac tanitti. Microsoft ThinkingBox adli bu sandbox sistemi, AI ajanlarinin gercek is senaryolarinda ne kadar guvenilir calistigini objektif olarak olcuyor. Arastirma sonuclari, en iyi AI ajanlarinin gorevlerin yuzde 91’ini en az bir kez basariyla tamamladigini, ancak ayni gorevleri her seferinde basariyla yerine getirme oraninin yalnizca yuzde 25 oldugunu gosteriyor.

AI Ajanlar Neden Her Defasinda Basarili Olamiyor?

Geleneksel AI degerlendirme yontemleri, bir ajanin bir gorevi bir kez basariyla tamamlamasina odaklaniyor. Ancak Microsoft ThinkingBox arastirmasi, gercek dunyada basarinin yalnizca bir kez olcumenin yaniltici olabilecegini ortaya koyuyor. Ajanlar bir kez basarili olabilir, ancak ayni kosullar altinda ayni sonucu tekrarlayamayabilir.

Arastirmacilara gore basarisiz calisan ajanlarin yuzde 80’i disaridan bakildiginda basarili gorunuyor. Ajan veritabanina yazan bir arac cagirir, islem tamamlandi mesaji dondurur ancak kayitlar eksik veya hatali olabilir. Ajan isin bittigini soylerken, sistem kayitlari aksini gosteriyor.

ThinkingBox Benchmark: 507 Gercek Is Senaryosu

Microsoft ThinkingBox-bench, perakende, konaklama, oto sigorta, neobanka IT, danismanlik IT ve HR destek gibi cesitli alanlarda 507 politika kosullu is akisi iceriyor. Her deneme, gecerli yorungeleri kabul ederken yanlis, eksik veya fazla etkileri reddeden gorev-ozel yurutulebilir kontrollerle degerlendiriliyor.

Sonuclar endise verici: En guclu model yuzde 65.36 pass@1 elde ederken, ayni model yuzde 25.25 pass@20 skoruna dustu. Bu, yapay zeka ajanlarinin zaman zaman dogru cevap uretmesinin, her zaman guvenilir sekilde calistigi anlamina gelmedigini gosteriyor.

AI Ajan Testlerinde Devrim Niteliginde Yenilik

Microsoft’in bu calismasi, AI ajan degerlendirmesinde yeni bir cagri niteligi tasiyor. Geleneksel yontemler yanit seviyesinde veya arac cagirisi seviyesinde kontrol yapiyor. Ancak ThinkingBox, veritabani durumunu sonrasinda kontrol ederek uctan uca gorevi tamamlama basarisini olcuyor.

Bu yaklasim, ornegin bir musteri siparisinin gercekten veritabanina islenip islenmedigini veya bir sigorta talebinin dogru sekilde kaydedilip kaydedilmedigini kontrol ediyor. Ajanin verdigi yanit degil, arkautaki veri durumu degerlendiriliyor.

Sonuc: Tek Basari Gercel Guvenilirligi Garanti Etmiyor

Microsoft’in arastirmasi, AI ajanlarinin gelecegi acisindan kritik bir uyari iceriyor. Bir ajanin bir kez basarili olmasi, her zaman basarili olacagi anlamina gelmiyor. Is dunyasinda kullanilan AI ajanlarindan gercek guvenilirlik beklemek icin pass@20 gibi coklu calistirma metriklerine bakmak gerekiyor.

GitHub: https://github.com/microsoft/thinkingbox | Arxiv: arxiv.org/abs/2608.19741

Kaynak: @rohanpaul_ai / X

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları