CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
1 Sep 2026 · 02:41 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.532 31 Ağu 2026 · Pazartesi

Kodlama Ajani Benchmark: Model Sabit, Harness Degisince Performans Yuzde 75 Artti

Yapay zeka destekli kodlama ajanlarinda kodlama ajani benchmark sureclerinin artik yalnizca "hangi model?" sorusuna indirgenemeyecegi ortaya cikti.

AiHaber Editör
Editör
2DK 4OKUMA

★ Hızlı Özet

  • Yapay zeka destekli kodlama ajanlarinda kodlama ajani benchmark sureclerinin artik yalnizca "hangi model?" sorusuna indirgenemeyecegi ortaya cikti.
  • Arastirmacilar iki farkli yapilandirmayi karsilastirdi.
  • Calisma, 169 SWE-bench Verified gorevi uzerinde ve 20.480 token penceresi ile gerceklestirildi.
  • Qwen3.6 modeli sabit tutuldugunda, tedavi grubunda ortalama F2PF (Fonksiyonel-Islevsel Test Pass Rate) yuzde 28den yuzde 49a yukseldi.

Yapay zeka destekli kodlama ajanlarinda kodlama ajani benchmark sureclerinin artik yalnizca “hangi model?” sorusuna indirgenemeyecegi ortaya cikti. Yuj Arastirma ekibi tarafindan yapilan yeni bir calisma, model sabit tutuldugunda bile harness (calisma cercevesi) degisikliklerinin kodlama performansini dramatik sekilde iyilestirebildigini gosterdi.

Yuj Yontemi: Sikismis Baglamda Kodlama Performansi

Arastirmacilar iki farkli yapilandirmayi karsilastirdi. Kontrol grubu, baglam penceresi dolana kadar tam kronolojik transkripti korurken; tedavi grubu eski ara ciktilarini kisaltarak daha az yer kaplamasini sagladi, duraksama davranislarini tespit etti ve sabit komut guvenlik onlemlerini uyguladi. Her iki yaklasimda da tam kayit korundu, ancak baglam kullanimi farkli sekilde yonetildi.

Calisma, 169 SWE-bench Verified gorevi uzerinde ve 20.480 token penceresi ile gerceklestirildi. Sonuclar, harness degisikliklerinin kodlama ajani benchmark sonuclarini koklu bicimde etkiledigini ortaya koydu.

SWE-bench Sonuclari: Yuzde 75 Artis

Qwen3.6 modeli sabit tutuldugunda, tedavi grubunda ortalama F2PF (Fonksiyonel-Islevsel Test Pass Rate) yuzde 28den yuzde 49a yukseldi. Bu, performansin neredeyse yuzde 75 arttigi anlamina geliyor. Tam cozum orani ise 43 gorevden 72 goreve cikti.

Ilgi cekici olan su ki, ayni sabit tedavi yaklasimi Devstral, Nemotron ve Qwen3.8 modellerinde de hem F2PF hem de tam cozum oranlarini artirdi. Ek olarak, herhangi bir yeniden ayarlama yapilmadan bu sonuclar elde edildi.

Buyuk Baglam Pencerelerinde Fark Azaliyor

Calismanin en kritik bulgusu, baglam penceresi 262.144 tokene genisletildiginde, Verified ve Pro sonuclarinin her iki grup arasinda neredeyse esit hale gelmesiydi. Bu durum, harness optimizasyonunun en guclu etkisini, baglamin gercek anlamda kisitlayici oldugu durumlarda gosterdigini ortaya koyuyor.

Tedavi grubu ayni zamanda basinc altinda daha fazla model calismasi kullandi. Arastirmacilar, paketin butunsel olarak test edildigini ve her mekanizmanin izole edilmedigini belirtti.

AI Kodlama Dunyasi Icin Dersler

Bu calisma, yapay zeka kodlama ajanlarinin benchmark sureclerinde koklu bir paradigma degisikligini isaret ediyor. Artik yalnizca model secimi degil, ayni zamanda harness mimarisi, baglam politikasi, aract seti ve calisma kontrolleri de bir butun olarak degerlendirilmeli.

Baska bir deyisle, bir kodlama ajaninin performansi; hangi modelin kullanildiginin otesinde, o modelin nasil calistirildigina, baglamin nasil yonetildigine ve hangi araçlarin entegre edildigine bagli. Gelistiriciler ve arastirmacilar icin bu, kodlama ajani benchmark metodolojilerini yeniden dusunnme zamaninin geldigini gosteriyor.

aihaber.org olarak, yapay zeka kodlama ajanlarindaki gelismeleri yakinen takip etmeye devam edecegiz. Yapay zekanin yazilim gelistirme sureclerine entegrasyonu hiz kazanirken, bu tur benchmark calismalari sektorun gelecek yonelimlerini sekillendirecek kritik veriler sunuyor.

Ilgili Makaleler:

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları