
Yapay zeka alanında yeni bir dönüm noktasına ulaşıldı. GPT-5.6 Sol Max, ARC-AGI-2 benchmark testinde yuzde 92,5 basari orani elde ederek, yalnızca 449 gün içinde yuzde 6,5’ten yuzde 92,5’e ulaşarak yapay zeka tarihinin en hızlı ilerleme grafiğini ortaya koydu.
ARC-AGI Benchmark Nedir?
ARC-AGI, Abstraction and Reasoning Corpus for Artificial Intelligence (Soyutlama ve Muhakeme Korpusu) testi, yapay zeka sistemlerinin karşılaştığı en zorlu değerlendirme araçlarından biri. Bu test, modellerin gorsel soyut muhakeme, sembolik anlama, birleşik kurallar ve tamamen yabancı problemlere karsı kalıpları bağımsız keşfedebilme kapasitelerini ölçüyor. Standart bilgi ezberleme veya matematik problemleri değil; modelin gerçek anlamda soyut dusunme yeteneğini test ediyor.
Zaman Cizelgesi: 449 Gonde 14 Kat Ilerleme
AI ilerlemesinin hızını anlamak için tarihsel verilere bakmak yeterli:
- 2025 Nisan: o3 modeli yuzde 6,5 basari orani ile piyasaya sürüldüğünde, bu sonuç bile en güçlü modellerin yuzde 1-5 aralığında kaldığı dönemde çığır açıcıydı
- 449 gün sonra: GPT-5.6 Sol Max, aynı testte yuzde 92,5 basariya ulaşti
Bu yuzde 6,5 yuzde 92,5 sicrama, 14 katlık bir ilerleme anlamına geliyor ve AI araştırmalarının ne denli hızlı evrildiğinin en somut kanıtı.
Maliyet Verimliligi: Daha Iyi Sonuc, Daha Dusuk Maliyet
Belki de en sasirtici olan, bu muhteşem performans artışının maliyet bazında minimal bir artışla gerçekleşmiş olması:
- o3 (yuzde 6,5 basari): Soru başına 0,834 dolar — en düşük doğruluk oranında toplam maliyet 51,3 dolara kadar çıkıyordu
- GPT-5.6 Sol Max (yuzde 92,5 basari): Soru başına yalnızca 1,44 dolar
Başka bir deyişle, hem kalite 14 kat artti hem de sorun başına maliyet neredeyse aynı kaldi. AI artık yalnızca daha iyi sonuç vermekle kalmıyor, aynı zamanda bu sonuçları daha verimli şekilde üretiyor.
Bu Ilerleme Ne Anlama Geliyor?
Bu sonuçlar, yapay zeka alanında kritik bir eşiğin geçildiğini gösteriyor. GPT-5.6 Sol Max‘in ARC-AGI testinde yuzde 92,5 basariya ulaşmasi, en güçlü AI sistemlerinin artık insan ortalamasının uzerinde performans gösterebildiği anlamına geliyor. Ancak benchmark sonuçları her zaman gerçek dünya performansını yansıtmayabilir; Agent sistemlerinin stabilitesi ve model yeteneklerinin ürün değerine dönüşüm süreçleri hâlâ devam ediyor.
Henüz yorum yok. İlk yorumu siz yapın!