CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
15 Sep 2026 · 21:46 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
MODEL HABERLERI SAYI #2.601 15 Eyl 2026 · Salı

GPT-5.6 Luna vs GPT-6 Astra: kod incelemede ucuz model yeter mi?

Entelligence, Aditya Jha imzalı 14 Eylül 2026 tarihli blog yazısında GPT-5.6 Luna ile GPT-6 Astra’yı aynı kod inceleme (code review) senaryosunda karşılaştırdı.

AiHaber Editör
Editör
6DK 4OKUMA

★ Hızlı Özet

  • Entelligence, Aditya Jha imzalı 14 Eylül 2026 tarihli blog yazısında GPT-5.6 Luna ile GPT-6 Astra’yı aynı kod inceleme (code review) senaryosunda karşılaştırdı.
  • Önceki yazıda Astra ile GPT-5.6 Sol kıyaslanmıştı.
  • 50 pull request’te Luna 69, Astra 92 doğrulanmış hata buldu.
  • Entelligence’in okuması: Luna, bu fiyata günlük doğruluk (correctness) hataları için yeterli; kimlik doğrulama veya izin kodunu tek başına i…

Entelligence, Aditya Jha imzalı 14 Eylül 2026 tarihli blog yazısında GPT-5.6 Luna ile GPT-6 Astra’yı aynı kod inceleme (code review) senaryosunda karşılaştırdı. Luna’nın fiyatı milyon giriş token’ı başına 0,20 dolar, çıkış token’ı başına 1,20 dolar; Astra’nınki sırasıyla 10 ve 50 dolar. Aynı pull request’lerde tek bir Luna incelemesi ortalama 0,0041 dolar, Astra incelemesi 0,113 dolar tuttu — yaklaşık 28 kat fark.

Önceki yazıda Astra ile GPT-5.6 Sol kıyaslanmıştı. Bu kez soru şuydu: her PR en ucuz modelden geçerse ne kaybedilir?

Kısa sonuç: 69’a 92 doğrulanmış hata

50 pull request’te Luna 69, Astra 92 doğrulanmış hata buldu. Tüm koşunun toplam maliyeti Luna için 0,20 dolar, Astra için 5,66 dolar oldu. Luna daha sık yanıldı: 93 bulgusunun 24’ü doğrulamadan geçmedi; Astra’da 96 bulgudan yalnızca 4’ü başarısızdı. Güvenlik hatalarında Luna 24’ün 9’unu, Astra 19’unu yakaladı.

Entelligence’in okuması: Luna, bu fiyata günlük doğruluk (correctness) hataları için yeterli; kimlik doğrulama veya izin kodunu tek başına inceletmeyeceklerini yazıyorlar.

  • Doğrulanmış hata: Luna 69 — Astra 92
  • Bulgu sayısı: Luna 93 — Astra 96
  • Hassasiyet (precision): Luna %74 — Astra %96
  • 50 PR toplam maliyet: Luna 0,20$ — Astra 5,66$
  • Doğrulanmış hata başına maliyet: Luna ~0,0030$ — Astra ~0,061$
  • İnceleme süresi (ortalama): Luna 23 sn — Astra 36 sn

Luna, Astra’nın doğrulanmış hata sayısının yüzde 75’ini, parasının yüzde 3,6’sıyla buldu. Doğrulanmış hata başına Astra yaklaşık 20 kat daha pahalıydı. Luna inceleme başına 3,1 kat daha fazla çıkış token’ı ürettiği halde çıkış fiyatı 42 kat düşük olduğu için yine çok daha ucuza geldi.

Nasıl test edildi?

Kurulum, Astra–Sol yazısıyla aynı tutuldu. PR’ler AI-Code-Review-Evals organizasyonundaki 50 herkese açık kıyaslama PR’si; Cal.com, Sentry, Discourse, Keycloak ve Grafana’dan onar adet. Her PR temiz bir taban dalına kasıtlı kusurlar ekliyor.

İki model aynı diff’e aynı istemi (prompt) aldı: doğruluk, güvenlik, eşzamanlılık, kaynak ve hata yönetimi; stil, isimlendirme, dokümantasyon ve test önerileri dışarıda. Bulgular yapılandırılmış döndü.

Doğrulama: her PR için Astra, Sol, Luna ve kamuya açık Entelligence inceleme yorumlarından gelen bulgular anonim bir listede birleştirildi. GPT-6 Astra ile GPT-5.6 Sol listeyi ayrı ayrı yargıladı; bir konu ancak her iki yargıç da “gerçek hata” dediğinde sayıldı. Yargıçlar bulguların yüzde 91’inde anlaştı; 143 ayrı hata her iki yargıçtan geçti. Luna bulguları havuzu değiştirdiği için her şey yeniden yargılandı; Astra’nın doğrulanmış sayısı önceki yazıdaki 91’den 92’ye, Sol’unki 107’den 108’e çıktı. Astra’nın hem yarışmacı hem yargıç olması hafif yanlılık riski taşıyor; yazı bunu sınırlar bölümünde belirtiyor.

Nerede geride kalıyor: Keycloak ve güvenlik

Sentry, Discourse ve Grafana’da Luna, Astra’ya iki doğrulanmış hata farkıyla yaklaştı. Cal.com’da fark daha genişti (21’e 30). En geniş fark Keycloak’taydı: Luna 6, Astra 14 doğrulanmış hata; Luna’nın Keycloak bulgularının yalnızca yüzde 50’si tutarken Astra’da oran yüzde 93’tü. Keycloak bir kimlik ve erişim yönetimi sunucusu; kıyaslama PR’lerinin çoğu kimlik doğrulama ve izin mantığını değiştiriyor.

Hata sınıfı etiketlemesi (GPT-5.6 Sol’un 143 hata üzerinden tek geçişiyle, tanımlar yazılı): veri/mantık hatalarında Luna 39, Astra 47; eşzamanlılıkta 10’a 13; güvenlik hatalarında Luna 24’ün 9’unu, Astra 19’unu buldu.

Astra’nın yakalayıp Luna’nın kaçırdığı Keycloak örneklerinden ikisi: federasyon kurtarma kodlarının kullanılmış sayılmaması (aynı kodun birden fazla kullanılabilmesi) ve küresel “view” izninin istemci bazlı reddetmeleri ezmesi. Bunlar tek satırda “yanlış” görünmüyor; izin modelinin değişiklik sonrası neye izin verdiğini çözmek gerekiyor.

Luna’nın Astra’nın kaçırdıkları

143 doğrulanmış hatanın 44’ünü her iki model de buldu; 48’ini yalnızca Astra, 25’ini yalnızca Luna yakaladı. Luna’ya özgü 25 hatanın 16’sı veri/mantık, 4’ü eşzamanlılık. Örnekler: Discourse’ta abonelikten çıkma isteğinin tekrarı kullanıcının bildirim seviyesini sürekli düşürüyordu; Sentry’de sağlıksız worker thread’leri değiştirirken eskilerin durdurulmaması.

Her PR’de iki modeli birlikte çalıştırmak, 143’ün 117’sini (yüzde 82) toplam 5,86 dolara bulurdu: Astra’nın 5,66 dolarına Luna’nın 0,20 doları eklenerek 25 ek doğrulanmış hata.

Okuyucu soruları ve sınırlar

Modellerin düzeltmeleri “ezberlemiş” olabileceği itirazına yanıt: PR’lerin arkasındaki commit tarihleri 2013–25 Temmuz 2025; 20’si 2025’ten ve hiçbiri modellerin eğitim kesim tarihinden sonra değil. Kusurlar kıyaslama için bilerek eklendiği için tam hata metni eğitim verisinde olmayabilir; çevre kod ise eski ve kamuya açık.

Tekrarlanabilirlik için kod tabanı başına iki PR, her modelde iki ek koşu yapıldı. İlk koşuda Astra’nın o on PR’deki 15 doğrulanmış hatasından 10’u her iki tekrarda, 14’ü en az birinde geri geldi; Luna’da da 15 vardı, 7’si her iki tekrarda, 12’si en az birinde. Örnek küçük; Luna tek koşudan koşuya daha sık kayıp gösterdi.

Her iki modelin de kaçırdığı alt sınır: 26 doğrulanmış hata yalnızca Sol veya Entelligence incelemesi tarafından yakalandı. Modeller yalnızca diff gördü (depo geçmişi, çağrı grafiği, üretim verisi yok). Doğrulanmış sayılar mevcut hataların tabanı; kıyaslamada eksiksiz hata listesi yok.

Entelligence’in özeti: ucuz model çoğu değişiklikte iyi, kimlik doğrulama ve izin kodunda zayıf; diff tek başına değişikliğin ne tür olduğunu söylemiyor. Şirket, kendi kod inceleme ürününün tam depo bağlamı ve üretim geri bildirimi kullandığını; Model Router’ın rutin adımları ucuz, zor adımları güçlü modellere verdiğini not ediyor.

Kaynak: Entelligence – GPT-5.6 Luna vs GPT-6 Astra: Is a $1.20 Model Good Enough for Code Review?

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları