Yapay zeka testlerinde önemli bir başarı daha elde edildi. Nvidia’nın genel amaçlı kodlama aracı AVO, ARC-AGI-3 interaktif muhakeme benchmark’ında yüzde 100 başarı oranına ulaşmayı başardı.
AVO ve Claude Opus 5 İşbirliği
Nvidia AVO, Claude Opus 5‘in temel performansını yüzde 30’dan yüzde 100’e kadar yükseltmeyi başardı. AILeaksAndNews hesabından yapılan paylaşıma göre, AVO sistemi 183 farklı seviyeyi ve 25 farklı genel ortamı tamamladı. Sistem, kendisine verilen talimatlar, açık kurallar veya belirlenmiş hedefler olmadan ne yapması gerektiğini tam olarak anlayarak hareket etti.
Neden Bu Sonuç Önemli?
ARC-AGI testleri, yapay zeka modellerinin soyut düşünme, problemi çözme ve gerçek dünyada karar verme yeteneklerini ölçen en önemli benchmark’lar arasında yer alıyor. Uzmanlar, bunun yeni bir AI eval (değerlendirme) sistemine geçiş için zamanın geldiğini düşünüyor.
AI Kodlama Asistanlarının Yükselişi
Bu gelişme, AI kodlama asistanlarının kurumsal yazılım geliştirmede kritik bir rol üstlenmeye başladığını gösteriyor. Claude Opus 5 gibi ileri düzey modeller, Nvidia’nın AVO aracıyla birlikte kullanıldığında çok daha yüksek başarı oranları elde edebiliyor.
Kaynak: @AILeaksAndNews (X/Twitter)
Henüz yorum yok. İlk yorumu siz yapın!