CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
6 Oct 2026 · 00:34 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
AI ARAçLARı SAYI #2.770 4 Eki 2026 · Pazar

Microsoft ThinkingBox, ajanı veritabanının son haliyle ölçüyor

Microsoft ve Hugging Face, 3 Ekim 2026’da ThinkingBox ajan kum havuzunu ve ThinkingBox-Bench ölçütünü yayımladı.

AiHaber Editör
Editör
4DK 18OKUMA

★ Hızlı Özet

  • Microsoft ve Hugging Face, 3 Ekim 2026’da ThinkingBox ajan kum havuzunu ve ThinkingBox-Bench ölçütünü yayımladı.
  • Araç çağrısı sonuç değil Yazıdaki örnek bir perakende görevi: kurye istisnası açıkken ajan bileti çözüldü diye kapatıyor ve müşteriye işin b…
  • Üç sayı ayrı raporlanıyor.
  • Bir kez tutmak yetmiyor Görev ağırlıklı pass@1’de Claude Opus 5.5 yüzde 67,16 ile önde. Claude Opus 5 yüzde 66,50, GPT-5.4 yüzde 65,36, GPT-…

Microsoft ve Hugging Face, 3 Ekim 2026’da ThinkingBox ajan kum havuzunu ve ThinkingBox-Bench ölçütünü yayımladı. Yazıyı Tuhin Kundu imzaladı. Ölçüt, ajanın son cümlesine veya araç çağrısının biçimli olup olmadığına değil, iş bitince veritabanında ve yan etkilerde ne kaldığına bakıyor. Her görev temiz bir arka uçtan 20 kez çalışıyor. Kum havuzu ve veri Hugging Face’te, OpenEnv arayüzünün arkasında.

Araç çağrısı sonuç değil

Yazıdaki örnek bir perakende görevi: kurye istisnası açıkken ajan bileti çözüldü diye kapatıyor ve müşteriye işin bittiğini söylüyor. Gerekli son durum ise bekleme. Araç çağrıları düzgün görünüyor; kayıt uymuyor. Ortak küme ayıklamasında 12 model, 121.680 geçerli deneme yaptı. Çalıştırılabilir denetimden 79.853 deneme kaldı. Bu başarısızların yüzde 67,24’ü temiz bitti, durum değiştiren bir araç çağırdı ve son araç hatası bildirmedi. Yine de yüzde 77,61’inde yanlış alan, yüzde 43,30’unda istenmeyen ek etki, yüzde 25,36’sında eksik zorunlu etki vardı. Bu üç bulgu üst üste binebiliyor.

Üç sayı ayrı raporlanıyor. pass@1, denemelerin ne kadarının tuttuğu. pass@20, 20 denemede en az bir kez çözülen görev payı. Gözlenen 20/20, 507 görevin kaçında 20 denemenin de tuttuğu. Bu sonuncu sayı tahmin değil, düz sayım.

Bir kez tutmak yetmiyor

Görev ağırlıklı pass@1’de Claude Opus 5.5 yüzde 67,16 ile önde. Claude Opus 5 yüzde 66,50, GPT-5.4 yüzde 65,36, GPT-5.6 Sol yüzde 61,91, Claude Sonnet 4.6 yüzde 59,19, GPT-6 Astra yüzde 58,31. Açık ağırlıkta en yüksek Kimi-K3, yüzde 57,37. Alan farkı büyük: Claude Opus 4.6 perakendede yüzde 68,62, oto sigortada yüzde 8,30. Tablodaki modellerin ortalamasında perakende pass@1 yüzde 59,52, oto sigorta yüzde 33,83.

Yirmi tekrarda pass@1’in ne kadarının kaldığı ayrı. GPT-6 Astra tek deneme oranının yüzde 78’ini koruyor. Claude Opus 5.5 ve Claude Opus 5 yüzde 71’ini koruyor. GLM-5.1, Kimi-K2.6 ve DeepSeek-V4-Pro yaklaşık yüzde 8’ini koruyor. Kimi-K3 görevlerin yüzde 93,89’unu en az bir kez çözüyor (476 / 507) ama 20’de 20 tutan görev yalnızca 68, yani yüzde 13,41. Claude Opus 5 en az bir kez yüzde 79,09 çözüyor; her denemede tutan pay ise yüzde 47,53. Claude Opus 5.5 pass@1’de daha yüksek ve daha çok görevi en az bir kez çözüyor. Yirmi denemenin hepsinde geçen görev sayısı ise Opus 5 ile aynı: 241.

Tutarlılığın maliyeti

Maliyet, 20 Eylül 2026 OpenRouter liste fiyatından, indirimler geri alınarak ve kuantizasyon bildiren uçlar elenerek tahmin. Başarılı deneme başına en düşük maliyet GPT-5.6 Sol’da 0,127 dolar. GPT-5.4, 507 tek denemelik turu 43,49 dolara mal edip pass@1 yüzde 65,36 ile başarılı deneme başına 0,131 dolar. Claude Opus 5.5 deneme başına 0,276 dolar. Pareto sınırında bu üçü var. Claude Opus 5, deneme başına 0,475 dolar ve yüzde 66,50 ile hem daha pahalı hem Opus 5.5’ten daha düşük.

Her denemede tutan görev başına maliyet ayrı hesap. GPT-5.4, 128 görev için 6,80 dolar. GPT-6 Astra 231 görev için 7,45 dolar (20 tur tahmini 1.720,60 dolar). Claude Opus 5.5, 241 görev için 7,80 dolar. Aynı 241 görevi Opus 5, 13,30 dolara getiriyor. Yazı bunların fatura değil karşılaştırma endeksi olduğunu belirtiyor.

Başarısız izlere tek bir tanı konuyor. Makaledeki ayıklamada başarısızlıkların yüzde 79,9’u araç kullanımı, yüzde 10,3’ü yanlış durum güncellemesi, yüzde 7,0’ı eksik kullanıcı çözümü, yüzde 2,9’u durum değiştiren eylem olmaması. 507 görevin 477’si yalnız duruma, 30’u ek yanıt rubriğine bakıyor. Altın durum, denetimler ve kimlik bilgileri modelin göremediği değerlendirici tarafında. Kod MIT, ölçüt verisi CDLA-Permissive-2.0, OpenEnv ortamı BSD-3-Clause. Ayrıntılı sonuçlar arXiv:2608.19741’de.

Kaynak: Hugging Face — Microsoft ThinkingBox

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları