CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
27 Sep 2026 · 11:12 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
AYıN TRENDLERI SAYI #2.704 17 Ağu 2026 · Pazartesi

Harness-IF: ByteDance Yapay Zeka Ajanlarinda Komut Takibi Degerlendirme Sistemi

Harness-IF, ByteDance arastirma ekibi tarafindan gelistirilen yeni bir degerlendirme sistemidir.

AiHaber Editör
Editör
2DK 16OKUMA

★ Hızlı Özet

  • Harness-IF, ByteDance arastirma ekibi tarafindan gelistirilen yeni bir degerlendirme sistemidir.
  • Varolan komut takibi kiyaslamalarinin temel sorunu, bir ajanin bir kurala uyum saglamasinin gercekten o kurali izledigi icin mi yoksa zaten …
  • Sistem, operasyonel kurallari yurutme kanitlarindan tek tek puanlandirir.
  • Against-Prior Accuracy: Tesadufi Uyumluluktan Gercel Komut Takibine

Harness-IF, ByteDance arastirma ekibi tarafindan gelistirilen yeni bir degerlendirme sistemidir. Kodlama ajanlarinin komutlara gercekten uyup uymadigini olcen bu sistem, mevcut kiyaslama testlerinin yanilgilarini ortaya koyuyor.

Mevcut Testlerin Yanilgisi

Varolan komut takibi kiyaslamalarinin temel sorunu, bir ajanin bir kurala uyum saglamasinin gercekten o kurali izledigi icin mi yoksa zaten yapmak uzere oldugu bir sey yaptigi icin mi oldugunu ayirt edememeleridir. Harness-IF, bu sorunu yeni bir metrikle ele alir.

Harness-IF Nasil Calisiyor?

Sistem, operasyonel kurallari yurutme kanitlarindan tek tek puanlandirir. Degerlendirme sureci sudur:

  • 60 gercekci cok donuslu kodlama senaryosu
  • 642 kuralli bir kutuphaneden 256 kurala karar verilmesi
  • Bes yapilandirilabilir yuzey uzerinde test edilmesi

Against-Prior Accuracy: Tesadufi Uyumluluktan Gercel Komut Takibine

Arastirmacilar, uyumluluk ile tesadufi eslesmeyi ayirmak icin Against-Prior Accuracy (AP-Acc) metrigini tanitti. 12 frontier model uzerinde yapilan testlerde, standart dogruluk orani %72.1-85.9 arasinda olculurken, AP-Acc %66.1-78.6 arasinda kaldi.

Kluc Bulgu: Standart Puanlamalar Uyumlulugu Abartiyor

Her model, kendi varsayilan davranisina karsi koyan kurallarda 3.6 ile 7.4 puan arasinda daha dusuk performans gosterdi. Toplam puanlar gercek komut uyumunu abartiyor ve kiyaslama siralamalarinin guvenilirligini sorgulatiyor.

Yapay Zeka Ajanlari Icin Dunya Etkileri

Bu bulgular, kodlama ajanlarini guvenlik, gizlilik ve uyumluluk kurallarina gore dagitan ekipler icin dogrudan sonuclar tasiyor. Harness-IF, yalnizca bir degerlendirme araci degil, ayni zamanda ajanlarin komutlari gercekten takip etmesini saglamak icin rehberlik sunan kapsamli bir cercevedir.

Kaynak: arxiv.org/abs/2608.11727

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları