CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
26 Aug 2026 · 07:44 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.146 26 Ağu 2026 · Çarşamba

WebDev Skills Benchmark: Agent Skill Enjeksiyonu Neden Performansi Dusturuyor?

AI agent sistemlerinde yaygin olarak kullanilan skill enkapsulasyon yaklasimi, beklenenin aksine performans dususune neden olabiliyor.

AiHaber Editör
Editör
1DK

★ Hızlı Özet

  • AI agent sistemlerinde yaygin olarak kullanilan skill enkapsulasyon yaklasimi, beklenenin aksine performans dususune neden olabiliyor.
  • WebDev-Skills-Bench, 31 farkli acik AI skillinin kodlama agentlari uzerindeki etkisini kapsamli sekilde oliyor.WebDev Skills Benchmark Nasil…

AI agent sistemlerinde yaygin olarak kullanilan skill enkapsulasyon yaklasimi, beklenenin aksine performans dususune neden olabiliyor. Yeni bir benchmark calismasi, bu yaygin uygulamanin ciddi sorunlarini ortaya koyuyor.

WebDev-Skills-Bench, 31 farkli acik AI skillinin kodlama agentlari uzerindeki etkisini kapsamli sekilde oliyor.

WebDev Skills Benchmark Nasil Calisiyor?

WebDev-Skills-Bench, 50 Web-Bench projasi ve 1.000 sirali gorev uzerinde 31 farkli acik WebDev skillini test etti. Calismanin ayirt edici ozelligi, uzunluk-eslestirilmis alakasiz kontrol ve leave-one-out bileşen ablasyonlari icermesi.

Sasirtici Sonuclar

Dort farkli model uzerinde yapilan testlerde, hedef skill enjeksiyonu sunlari verdi: Ortalama Pass@2 yuzde 1,3 ile yuzde 4,2 oraninda dustu, gorev tamamlama derinligi azaldi ve token maliyeti yuzde 72 ile yuzde 394 arasinda artti.

Iki Temel Basarisizlik Modu

Uzunluk-Dagilmis Modeller: Enjekte edilen skillin uzunlugu performansi dogrudan dusrueyor.
Icerik-Yaniltilmis Modeller: Prompt uzunlugu notr olsa bile, skill iciagi modeli yaniltarak Pass@2yi dusrueyor.

Anti-Pattern Kurallari mi Ornek Agir Icerik mi?

Ilginc bir bulgu olarak, anti-pattern kurallari, ornek agirli icerikten daha iyi sonuc veriyor. Bu, skill tasariminda kalabalik ornekler yerine net, kural tabanli yapilarin tercih edilmesi gerektigine isaret ediyor.

Kaynak: arxiv.org/abs/2608.23067

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları