AI agent sistemlerinde yaygin olarak kullanilan skill enkapsulasyon yaklasimi, beklenenin aksine performans dususune neden olabiliyor. Yeni bir benchmark calismasi, bu yaygin uygulamanin ciddi sorunlarini ortaya koyuyor.
WebDev-Skills-Bench, 31 farkli acik AI skillinin kodlama agentlari uzerindeki etkisini kapsamli sekilde oliyor.
WebDev Skills Benchmark Nasil Calisiyor?
WebDev-Skills-Bench, 50 Web-Bench projasi ve 1.000 sirali gorev uzerinde 31 farkli acik WebDev skillini test etti. Calismanin ayirt edici ozelligi, uzunluk-eslestirilmis alakasiz kontrol ve leave-one-out bileşen ablasyonlari icermesi.
Sasirtici Sonuclar
Dort farkli model uzerinde yapilan testlerde, hedef skill enjeksiyonu sunlari verdi: Ortalama Pass@2 yuzde 1,3 ile yuzde 4,2 oraninda dustu, gorev tamamlama derinligi azaldi ve token maliyeti yuzde 72 ile yuzde 394 arasinda artti.
Iki Temel Basarisizlik Modu
Uzunluk-Dagilmis Modeller: Enjekte edilen skillin uzunlugu performansi dogrudan dusrueyor.
Icerik-Yaniltilmis Modeller: Prompt uzunlugu notr olsa bile, skill iciagi modeli yaniltarak Pass@2yi dusrueyor.
Anti-Pattern Kurallari mi Ornek Agir Icerik mi?
Ilginc bir bulgu olarak, anti-pattern kurallari, ornek agirli icerikten daha iyi sonuc veriyor. Bu, skill tasariminda kalabalik ornekler yerine net, kural tabanli yapilarin tercih edilmesi gerektigine isaret ediyor.
Kaynak: arxiv.org/abs/2608.23067
Henüz yorum yok. İlk yorumu siz yapın!