CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
12 Aug 2026 · 12:21 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #997 12 Ağu 2026 · Çarşamba

Terminal-Bench 3.0 Duyuruldu: Claude Opus 5 Max GPT-5.6 Sol’ü Geride Bıraktı

Terminal-Bench 3.0, terminal tabanlı yapay zeka modellerini değerlendiren en kapsamlı benchmark çalışması olarak yayımlandı.

AiHaber Editör
Editör
2DK 2OKUMA

★ Hızlı Özet

  • Terminal-Bench 3.0, terminal tabanlı yapay zeka modellerini değerlendiren en kapsamlı benchmark çalışması olarak yayımlandı.
  • Terminal-Bench 3.0 Sonuçları Terminal-Bench 3.0 benchmark'ında Claude Opus 5 Max, yüzde 43.5'lik etkileyici bir SoTA (State of the Art) skor…
  • Claude Opus 5 Max'in Parlaması Claude Opus 5 Max, özellikle terminal ortamında çalışan kodlama ve sistem yönetimi görevlerinde üstün perform…
  • GPT-5.6 Sol: İkinci Sırada Güçlü Rekabet OpenAI'nin GPT-5.6 Sol modeli, yüzde 34.6'lık skorla ikinci sırada yer almasına rağmen hâlâ güçlü b…

Terminal-Bench 3.0, terminal tabanlı yapay zeka modellerini değerlendiren en kapsamlı benchmark çalışması olarak yayımlandı. Bu yeni sürümde Claude Opus 5 Max, GPT-5.6 Sol modelini geride bırakarak zirveye oturdu. Terminal-Bench 3.0 sonuçları, yapay zeka kodlama asistanları arasındaki rekabetin ne denli kızışmış olduğunu gözler önüne seriyor.

Terminal-Bench 3.0 Sonuçları

Terminal-Bench 3.0 benchmark’ında Claude Opus 5 Max, yüzde 43.5’lik etkileyici bir SoTA (State of the Art) skoru elde etti. GPT-5.6 Sol ise yüzde 34.6’lık skorla ikinci sırada kaldı. Üçüncü sırada yer alan Fable 5, yüzde 24.1’lik skoruyla GPT-5.6 Sol’un hata payı içinde kalarak güçlü bir rekabet sergiledi.

Claude Opus 5 Max’in Parlaması

Claude Opus 5 Max, özellikle terminal ortamında çalışan kodlama ve sistem yönetimi görevlerinde üstün performans sergiledi. Bu sonuç, Anthropic’in modelinin gerçek dünya kodlama senaryolarında ne denli etkili olduğunu bir kez daha kanıtlamış oldu.

GPT-5.6 Sol: İkinci Sırada Güçlü Rekabet

OpenAI’nin GPT-5.6 Sol modeli, yüzde 34.6’lık skorla ikinci sırada yer almasına rağmen hâlâ güçlü bir performans sergiliyor. Fable 5’in yüzde 24.1’lik skoruyla GPT-5.6 Sol’ün hata payı içinde kalması, üst seviye modeller arasındaki rekabetin ne kadar yakın olduğunu gösteriyor.

Terminal-Bench Neden Önemli?

Terminal-Bench 3.0, yapay zeka modellerini gerçek terminal komutları ve görevleri üzerinden test eden nadir benchmark’lardan biri. Bu test, modellerin yalnızca kod yazma değil, aynı zamanda terminal komutlarını anlama, hata ayıklama ve sistem yönetimi konusundaki gerçek dünya yeteneklerini ölçüyor.

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları