CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
22 Aug 2026 · 18:51 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #1.902 21 Ağu 2026 · Cuma

ARC-AGI-3 Benchmark’ı Düştü: Yeni Yapay Zeka Değerlendirmesi Gerekli

NVIDIA AVO Yüzde 100'e Ulaştı ARC-AGI-3 benchmark testi artık geçerliliğini yitirmiş görünüyor. Nvidia AVO — Claude Opus 5 destekli genel amaçlı bir kodlama ajanı — yüzde 30 bazal performansından…

AiHaber Editör
Editör
2DK 4OKUMA

★ Hızlı Özet

  • NVIDIA AVO Yüzde 100'e Ulaştı ARC-AGI-3 benchmark testi artık geçerliliğini yitirmiş görünüyor. Nvidia AVO — Claude Opus 5 destekli genel am…
  • ARC-AGI-3, yapay genel zekayı (AGI) ölçmek için tasarlanmıştı: modelin talimat, açık kurallar veya belirtilen hedefler olmadan bir ortamda ne yapacağını keşfetmesi gerekiyordu.
  • AI Leaks and News'in "ARC-AGI-3 has fallen" açıklaması, benchmark tarihinde önemli bir dönüm noktasına işaret ediyor.

NVIDIA AVO Yüzde 100’e Ulaştı

ARC-AGI-3 benchmark testi artık geçerliliğini yitirmiş görünüyor. Nvidia AVO — Claude Opus 5 destekli genel amaçlı bir kodlama ajanı — yüzde 30 bazal performansından yüzde 100’e ulaşarak benchmarkın tüm 183 seviyesini tamamladı.

Ajan Destekli Performans Yükseltmesi

AVO’nun başarısı, mevcut frontier modellerinin ham yetenekleri ile ajan sistemlerinin sistematik problem çözme yaklaşımı arasındaki farkı gözler önüne seriyor. Bir modelin doğrudan testte yüzde 30 başarı elde etmesi, ajan pipeline’ı ile yüzde 100’e çıkması, testlerin artık gerçek “genel” zekayı değil, belirli aksaklıkları ölçüp ölçmediği sorusunu gündeme getiriyor.

ARC-AGI-3, yapay genel zekayı (AGI) ölçmek için tasarlanmıştı: modelin talimat, açık kurallar veya belirtilen hedefler olmadan bir ortamda ne yapacağını keşfetmesi gerekiyordu. AVO’nun 25 farklı ortamda 183 seviyenin tamamını çözmesi, mevcut benchmarkların ajan destekli sistemler tarafından aşınabileceğini gösteriyor.

Bu Ne Anlama Geliyor?

AVO’nun başarısı iki okumayla değerlendirilebilir: Birincisi, ajan mimarileriyle mevcut modellerin potansiyeli çok daha yüksek; ikincisi, benchmark’ın kendisi artık güvenilir bir AGI ölçütü olmaktan çıkmış olabilir. Her iki durumda da yapay zeka alanında yeni değerlendirme metriklarına ihtiyaç duyuluyor.

AI Leaks and News’in “ARC-AGI-3 has fallen” açıklaması, benchmark tarihinde önemli bir dönüm noktasına işaret ediyor. Yeni nesil değerlendirme sistemlerinin ne olacağı, önümüzdeki dönemde AI araştırmalarının en kritik gündem maddelerinden biri olacak.

İlgili Haberler

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları