Yapay Zeka Kodlama Ajanında Prompt Kaynaklı Asılı Harcama: Aynı Görev, 18 Kat Fazla Maliyet
Araştırmacılar yapay zeka kodlama ajani sistemlerinde kritik bir verimsizlik keşfetti: aynı kod…
Yapay Zeka Kodlama Ajanında Prompt Kaynaklı Asılı Harcama: Aynı Görev, 18 Kat Fazla Maliyet
Araştırmacılar yapay zeka kodlama ajani sistemlerinde kritik bir verimsizlik keşfetti: aynı kod değişikliğini aynı doğrulukla üreten iki farklı prompt, ajanın yaptığı iş miktarını ve dolayısıyla maliyeti kat be kat farklılaştırabiliyor. Üstelik başarı oranında hiçbir iyileşme olmadan. Çalışma, altı farklı open-weight reasoning modelinde bu etkinin 2,4 ile 7,4 kat arasında değiştiğini ortaya koyuyor.
Altı Modelde Aynı Test: Prompt Sözcükleri Ücreti Değiştiriyor
>Araştırma,
Same Task, Different Work: Prompt-Induced Waste in Coding Agents (arxiv.org/abs/2608.01347) başlığı altında yayınlandı. Yazarlar Sarel Weinberger ve Amir Hozez, dört bin altı yüz kırk dört geçerli test run, yirmi dört kodlama görevi, yedi model ve iki farklı agent harness üzerinde kapsamlı bir değerlendirme gerçekleştirdi. Çalışmada altı open-weight model üzerinde "birden fazla yaklaşım düşün" talimatı verildiğinde, ajanların reasoning süresi
2,4 ile 7,4 kat arasında arttı ancak başarı oranında hiçbir iyileşme gözlenmedi. Bunun arkasındaki mekanizma çarpıcı: ajanlar yaklaşık
üç alternatif geliştiriyor, hepsini eliyor ve yalnızca birini uyguluyor. Üç alternatif geliştirip hepsini eleme süreci gereksiz yere token ve hesaplama harcıyor.
"Mutlak Kesin Ol" Komutu: 18 Kat Daha Pahalı Bir Döngü
Araştırmanın en çarpıcı bulgusu "be absolutely certain" (mutlak kesin ol) talimatının tetiklediği davranış oldu. Bu komut, kod düzeltmesi tamamlandıktan sonra bile ajanı tekrar tekrar test yapmaya ve ek doğrulama döngülerine yönlendiriyor. En yüksek redundant doğrulama seviyesinde, run maliyeti clean-run medianının
18,25 katına çıktı. 6 yerine 15 araç çağrısı yapıldı, işlem süresi 3 kat uzadı ve başarı oranı değişmedi. Prompt uzunluğunun sonuçlar üzerinde pratikte hiç etkisi yokken, gereksiz tekrarlama düzeyi 1,0× civarında kaldı. Bu bulgular, ajan davranışının iki farklı maliyet yolu izlediğini gösteriyor: bazı promptlar yoğun reasoning gerektiriyor (token tabanlı maliyet), bazıları ise çok sayıda araç çağrısı tetikliyor (sistem tabanlı maliyet).
Sınırlı Talimat: En Küçük Yeterli Değişiklik, Sonra Dur
Araştırmacılar bir çözüm öneriyor:
bound instruction yani sınırlayıcı talimat. Bu yaklaşım ajana şunu söylüyor:
Hatalı testle başla → En küçük yeterli değişikliği yap → İlgili testleri çalıştır → Sonra dur. Bu sınırlı talimat, baseline reasoning seviyesinde veya altında kalarak gereksiz iş yükünü ortadan kaldırırken, tanılama ve doğrulama kalitesini korudu. Harness tasarımının da maliyeti 5 kat ile 30 kat arasında değiştirebildiği gözlendi.
Neden Önemli? Yapay Zeka Kodlama Ajanı Kullanan Her Geliştirici İçin Kritik
Bir
yapay zeka kodlama ajani hatasız kod üretse bile, kullandığız prompt onu gereksiz yere pahalı bir döngüye sokabilir. Bu, özellikle yüksek hacimli kod üretimi ve sürekli entegrasyon ortamlarında gerçek maliyetlere dönüşüyor. Çalışma, küçük görevlerde (en fazla dört dosya) elde edildiği için sonuçların büyük mimari çalışmalarına tam olarak yansıyacağı garantilenmiyor. Büyük projelerde problem tanımlama ve alternatif çözüm yollarını değerlendirmek daha kritik olabilir. Ancak temel ders net:
yapay zeka kodlama ajani ile çalışırken prompt tasarımı, ajanın ne üzerinde çalışacağını, ne kadar emek harcayacağını ve ne zaman duracağını doğrudan belirliyor. Doğru müdahale, maliyeti düşürürken doğruluk oranını koruyor.
Henüz yorum yok. İlk yorumu siz yapın!