
Yapay zeka arastirmalarinda yeni bir calisma, guclu yapay zeka modellerinin kod yazarak araclari yonetmesinin, geleneksel JSON tabanli tool calling yaklasimindan daha etkili olabildigini ortaya koydu. “The Bitter Lesson of Tool Calling” baslikli arxiv paper’i, programmatic tool calling yaklasiminin 14 modelden 11’inde JSON tabanli yonteme esit veya daha ustun performans gosterdigini belgeliyor.
Arastirma: Kod Tabanli Tool Calling’in Avantajlari
Arastirmacilar, BFCL v4 benchmark’inda 14 farkli dil modelini test etti. Sonuclar cesaret verici:
- GPT-5.6-Sol ve Terra modelleri, programmatic tool calling ile %10.6 iyilestirme kaydetti
- 14 modelden 13’u, paralel fan-out senaryosunda JSON tabanli yontemi geride birakti
- Sequential chain (ardisik zincir) cagirilar, 14 modelden 13’unde daha hizli sonuc verdi
Bu bulgular, kod yazabilen modellerin arac cagirilarini yonetme biçiminde temel bir degisiklige gittigini gosteriyor.
Claude Sonnet 5 Ornegi: 100 Cagri Sonrasinda Dusus
Arastirmanin en sansasyonel bulgularindan biri Claude Sonnet 5 ile ilgili. JSON tabanli cagri zincirlerinde, model 70. cagridan sonra ciktilari atmaya basladi. 100 cagri sonrasinda enumeration dogrulugu %0’a dustu. Ancak Python tabanli kod ile ayni testte %100 dogruluk korundu.
Bu bulgu, ozellikle cok sayida araca ihtiyac duyan yapay zeka ajani (AI agent) senaryolarinda kritik onem tasyor.
Programmatic Tool Calling Nasil Calisiyor?
Standart JSON tool calling‘de model, her cagri icin ayri bir JSON nesnesi olusturur ve sonuclar donene kadar bekler. Programmatic tool calling‘de ise model, ayni Python betigi icinde birden fazla araci cagirir ve sonuclari tek bir ajan doneminde isler.
Bu yaklasimin avantajlari: Paralel calistirma sayesinde bagimli cagrilar tek betik icinde toplanabilir; her cagri icin ayri model donemi gerekmez; ayrica uzun zincirlerde JSON tabanli yontemde yasanan “context rot” etkisi azalir.
Sinirliliklar ve Dikkat Edilmesi Gerekenler
Arastirmacilar, bazi eski GPT modellerinin bu yaklasimda daha kotu performans gosterdigini kaydetti. Bunun nedeni, bu modellerin bozuk multiline Python kodu uretmesi. Ayrica benchmark, gercek API’ler yerine echo-return stub’lari kullaniyor; bu da sonuclarin gercek dunyada farkli cikabilecegi anlamina geliyor.
AI Ajanlarinin Gelecegi
Bu bulgular, yapay zeka ajan teknolojisinin evriminde onemli bir donum noktasi isaret ediyor. Kod yazabilen modellerin artigi bir donemde, programmatic tool calling yaklasimi standart JSON tabanli cagri mimarisine guclu bir alternatif olabilir.
Arastirmaci ekip, bu yaklasimin ozellikle uzun baglamli gorevlerde ve coklu arac kullanimi gerektiren senaryolarda daha guvenilir sonuclar verdigini vurguluyor.
Kaynak: Rohan Paul / X (Twitter), arxiv.org/abs/2608.06370
Henüz yorum yok. İlk yorumu siz yapın!