NVIDIA AVO Yüzde 100’e Ulaştı
ARC-AGI-3 benchmark testi artık geçerliliğini yitirmiş görünüyor. Nvidia AVO — Claude Opus 5 destekli genel amaçlı bir kodlama ajanı — yüzde 30 bazal performansından yüzde 100’e ulaşarak benchmarkın tüm 183 seviyesini tamamladı.
Ajan Destekli Performans Yükseltmesi
AVO’nun başarısı, mevcut frontier modellerinin ham yetenekleri ile ajan sistemlerinin sistematik problem çözme yaklaşımı arasındaki farkı gözler önüne seriyor. Bir modelin doğrudan testte yüzde 30 başarı elde etmesi, ajan pipeline’ı ile yüzde 100’e çıkması, testlerin artık gerçek “genel” zekayı değil, belirli aksaklıkları ölçüp ölçmediği sorusunu gündeme getiriyor.
ARC-AGI-3, yapay genel zekayı (AGI) ölçmek için tasarlanmıştı: modelin talimat, açık kurallar veya belirtilen hedefler olmadan bir ortamda ne yapacağını keşfetmesi gerekiyordu. AVO’nun 25 farklı ortamda 183 seviyenin tamamını çözmesi, mevcut benchmarkların ajan destekli sistemler tarafından aşınabileceğini gösteriyor.
Bu Ne Anlama Geliyor?
AVO’nun başarısı iki okumayla değerlendirilebilir: Birincisi, ajan mimarileriyle mevcut modellerin potansiyeli çok daha yüksek; ikincisi, benchmark’ın kendisi artık güvenilir bir AGI ölçütü olmaktan çıkmış olabilir. Her iki durumda da yapay zeka alanında yeni değerlendirme metriklarına ihtiyaç duyuluyor.
AI Leaks and News’in “ARC-AGI-3 has fallen” açıklaması, benchmark tarihinde önemli bir dönüm noktasına işaret ediyor. Yeni nesil değerlendirme sistemlerinin ne olacağı, önümüzdeki dönemde AI araştırmalarının en kritik gündem maddelerinden biri olacak.
İlgili Haberler
- NVIDIA AVO ARC-AGI-3 Benchmark — NVIDIA AVO’nun detaylı başarı raporu
- OpenAI Astra Çıkış Tarihi — OpenAI’in yeni modeli Astra
- Claude Academy Anthropic — Anthropic eğitim platformu
Henüz yorum yok. İlk yorumu siz yapın!