Terminal-Bench 3.0, terminal tabanlı yapay zeka modellerini değerlendiren en kapsamlı benchmark çalışması olarak yayımlandı. Bu yeni sürümde Claude Opus 5 Max, GPT-5.6 Sol modelini geride bırakarak zirveye oturdu. Terminal-Bench 3.0 sonuçları, yapay zeka kodlama asistanları arasındaki rekabetin ne denli kızışmış olduğunu gözler önüne seriyor.
Terminal-Bench 3.0 Sonuçları
Terminal-Bench 3.0 benchmark’ında Claude Opus 5 Max, yüzde 43.5’lik etkileyici bir SoTA (State of the Art) skoru elde etti. GPT-5.6 Sol ise yüzde 34.6’lık skorla ikinci sırada kaldı. Üçüncü sırada yer alan Fable 5, yüzde 24.1’lik skoruyla GPT-5.6 Sol’un hata payı içinde kalarak güçlü bir rekabet sergiledi.
Claude Opus 5 Max’in Parlaması
Claude Opus 5 Max, özellikle terminal ortamında çalışan kodlama ve sistem yönetimi görevlerinde üstün performans sergiledi. Bu sonuç, Anthropic’in modelinin gerçek dünya kodlama senaryolarında ne denli etkili olduğunu bir kez daha kanıtlamış oldu.
GPT-5.6 Sol: İkinci Sırada Güçlü Rekabet
OpenAI’nin GPT-5.6 Sol modeli, yüzde 34.6’lık skorla ikinci sırada yer almasına rağmen hâlâ güçlü bir performans sergiliyor. Fable 5’in yüzde 24.1’lik skoruyla GPT-5.6 Sol’ün hata payı içinde kalması, üst seviye modeller arasındaki rekabetin ne kadar yakın olduğunu gösteriyor.
Terminal-Bench Neden Önemli?
Terminal-Bench 3.0, yapay zeka modellerini gerçek terminal komutları ve görevleri üzerinden test eden nadir benchmark’lardan biri. Bu test, modellerin yalnızca kod yazma değil, aynı zamanda terminal komutlarını anlama, hata ayıklama ve sistem yönetimi konusundaki gerçek dünya yeteneklerini ölçüyor.
Henüz yorum yok. İlk yorumu siz yapın!