CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
11 Aug 2026 · 11:56 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #866 11 Ağu 2026 · Salı

AI’da Devrim: GPT-5.6 Sol Max, ARC-AGI Benchmark’inda Yuzde 92,5 Basari Oranina Ulasti

Yapay zeka alanında yeni bir dönüm noktasına ulaşıldı. GPT-5.6 Sol Max, ARC-AGI-2 benchmark testinde yuzde 92,5 basari orani elde ederek, yalnızca 449 gün içinde yuzde 6,5'ten yuzde 92,5'e ulaşarak…

AiHaber Editör
Editör
2DK 2OKUMA

★ Hızlı Özet

  • Yapay zeka alanında yeni bir dönüm noktasına ulaşıldı.
  • ARC-AGI Benchmark Nedir?
  • Zaman Cizelgesi: 449 Gonde 14 Kat Ilerleme AI ilerlemesinin hızını anlamak için tarihsel verilere bakmak yeterli: 2025 Nisan: o3 modeli yuz…
  • Maliyet Verimliligi: Daha Iyi Sonuc, Daha Dusuk Maliyet Belki de en sasirtici olan, bu muhteşem performans artışının maliyet bazında minimal…

GPT-5.6 Sol Max ARC-AGI Benchmark Grafik

Yapay zeka alanında yeni bir dönüm noktasına ulaşıldı. GPT-5.6 Sol Max, ARC-AGI-2 benchmark testinde yuzde 92,5 basari orani elde ederek, yalnızca 449 gün içinde yuzde 6,5’ten yuzde 92,5’e ulaşarak yapay zeka tarihinin en hızlı ilerleme grafiğini ortaya koydu.

ARC-AGI Benchmark Nedir?

ARC-AGI, Abstraction and Reasoning Corpus for Artificial Intelligence (Soyutlama ve Muhakeme Korpusu) testi, yapay zeka sistemlerinin karşılaştığı en zorlu değerlendirme araçlarından biri. Bu test, modellerin gorsel soyut muhakeme, sembolik anlama, birleşik kurallar ve tamamen yabancı problemlere karsı kalıpları bağımsız keşfedebilme kapasitelerini ölçüyor. Standart bilgi ezberleme veya matematik problemleri değil; modelin gerçek anlamda soyut dusunme yeteneğini test ediyor.

Zaman Cizelgesi: 449 Gonde 14 Kat Ilerleme

AI ilerlemesinin hızını anlamak için tarihsel verilere bakmak yeterli:

  • 2025 Nisan: o3 modeli yuzde 6,5 basari orani ile piyasaya sürüldüğünde, bu sonuç bile en güçlü modellerin yuzde 1-5 aralığında kaldığı dönemde çığır açıcıydı
  • 449 gün sonra: GPT-5.6 Sol Max, aynı testte yuzde 92,5 basariya ulaşti

Bu yuzde 6,5 yuzde 92,5 sicrama, 14 katlık bir ilerleme anlamına geliyor ve AI araştırmalarının ne denli hızlı evrildiğinin en somut kanıtı.

Maliyet Verimliligi: Daha Iyi Sonuc, Daha Dusuk Maliyet

Belki de en sasirtici olan, bu muhteşem performans artışının maliyet bazında minimal bir artışla gerçekleşmiş olması:

  • o3 (yuzde 6,5 basari): Soru başına 0,834 dolar — en düşük doğruluk oranında toplam maliyet 51,3 dolara kadar çıkıyordu
  • GPT-5.6 Sol Max (yuzde 92,5 basari): Soru başına yalnızca 1,44 dolar

Başka bir deyişle, hem kalite 14 kat artti hem de sorun başına maliyet neredeyse aynı kaldi. AI artık yalnızca daha iyi sonuç vermekle kalmıyor, aynı zamanda bu sonuçları daha verimli şekilde üretiyor.

Bu Ilerleme Ne Anlama Geliyor?

Bu sonuçlar, yapay zeka alanında kritik bir eşiğin geçildiğini gösteriyor. GPT-5.6 Sol Max‘in ARC-AGI testinde yuzde 92,5 basariya ulaşmasi, en güçlü AI sistemlerinin artık insan ortalamasının uzerinde performans gösterebildiği anlamına geliyor. Ancak benchmark sonuçları her zaman gerçek dünya performansını yansıtmayabilir; Agent sistemlerinin stabilitesi ve model yeteneklerinin ürün değerine dönüşüm süreçleri hâlâ devam ediyor.

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları