NVIDIA‘nın yapay zeka kodlama ajanı AVO, ARC-AGI-3 benchmark testinde tum görevleri basariyla tamamlayarak yuzde 100 basari orani elde etti. Bu sonuc, yapay zeka sistemlerinin kodlama alanindaki en zorlu testlerden birinde yeni bir rekabet gücü göstergesi olarak degerlendiriliyor.
AVO Nasil Calisiyor?
ARC-AGI (Abstraction and Reasoning Corpus – Artificial General Intelligence), yapay zeka sistemlerinin soyut dusunme ve problem cozme yeteneklerini olcen bir benchmark testidir. NVIDIA AVO, bu testte sürekli olarak denetleme, planlama, uygulama ve degerlendirme dongusu icinde calisiyor. Sistem; bellek, araçlar ve yurutum geri bildirimlerini kullanarak ogrendiklerini biriktiriyor ve böylece her seferinde daha etkili hale geliyor.
Uzun Sureli Ogrenme Basarisi
AVO’nun en dikkat cekici ozelliklerinden biri, dilmodelinin baglam sifirlandiginda bile ogrendiklerini hatirlayabilmesi ve uzun sureler boyunca bu bilgiyi genisletebilmesidir. Bu yetenek, yapay zeka kodlama ajanlarinin gercek dunyada uzun soluklu projelerde kullanilabilirligi acisindan kritik onem tasiyor.
Claude Opus 5 Ile Guclendirildi
Sistemin arkasindaki temel dilmodeli Claude Opus 5. Ayni altyapi, daha once yedi gun boyunca GPU kodunu özerk olarak optimize eden sistemde de kullanildi. Bu, AVO’nun yalnızca bir benchmark ajani degil, ayni zamanda gercek dunya uygulamalarinda kanitlanmis bir sistem oldugunu gosteriyor.
Neden Öncmili?
ARC-AGI-3, yapay zeka sistemlerinin gercek dünya problemlerini ne kadar soyut dusunerek cozdigini test eden en zorlu benchmarklardan biridir. 100’luk basari oranina ulasmak, sistemin kurallari veya hedefleri önceden verilmeden, yalnizca deneme yanilma yoluyla ogrenmesi gereken gorevlerde tam basari elde ettigini gosteriyor. Bu da yapay zeka kodlama ajanlarinin artik yalnızca tekrar eden gorevleri degil, daha once karsilasilmamis problemleri de cozebilecek seviyeye ulastigina isaret ediyor.
Kaynak: TestingCatalog
Henüz yorum yok. İlk yorumu siz yapın!