CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
26 Aug 2026 · 08:39 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.149 26 Ağu 2026 · Çarşamba

LLM Benchmark Harness Yanliligi: AI Model Skorları Yapay Olarak Uretiliyor

Yeni bir akademik calisma, AI model degerlendirmelerinde kritik bir sorunu gun yuzune cikariyor: LLM benchmark harness sistemleri, modellerin gercek yeteneklerini degil, yapilandirma tercihlerini…

AiHaber Editör
Editör
1DK 2OKUMA

★ Hızlı Özet

  • Yeni bir akademik calisma, AI model degerlendirmelerinde kritik bir sorunu gun yuzune cikariyor: LLM benchmark harness sistemleri, modelleri…
  • DAIR.AI arastirmacisi V.S.

Yeni bir akademik calisma, AI model degerlendirmelerinde kritik bir sorunu gun yuzune cikariyor: LLM benchmark harness sistemleri, modellerin gercek yeteneklerini degil, yapilandirma tercihlerini oliyor.

DAIR.AI arastirmacisi V.S. Raghu Parupudi tarafindan yayimlanan calisma, modern LLM liderlik tablolarinin buyuk olcude yapay olarak uretildigini kanitliyor.

Arastirma Nasil Yapildi?

Calisma, 4 farkli model ailesinden 12 acik agirlikli talimat-hasar edilmis LLMi 26 farkli esit derecede savunulabilir harness yapilandirmasi altinda test etti. Tum modeller, ARC, HellaSwag, MMLU ve TruthfulQA benchmarklarindan ayni 3.679 soruyu yanitladi.

gemma4-31b: Yuzde 31 ile Yuzde 89 Arasinda

Arastirmanin en carpici bulgusu, gemma4-31b modelinin yalnizca harness degisimiyle yuzde 31 ile yuzde 89 arasinda skor alabilmesiydi.

Dort Farkli Model Birinci Olabiliyor

12 test edilen model arasindan 4 farkli model, yalnizca harness yapilandirmasini degistirerek birinci siraya yerlesebildi. Yuzde 95,7 oraninda performans farki, yapilandirma-kirilgan sorulardan kaynaklaniyor.

Scoring Metodu: Asil Kirilgan Eksen

Arastirmacilar, secenek siralamasinin yaygin benchmark protokollerinin duzeltmeye calistigi faktor olmadigini, asil yuk tasimaci eksenin scoring metodu oldugunu tespit etti.

Sikistirilmis Benchmarklar Paradoxu

Endustri, maliyet ve hiz avantaji icin benchmarklari sikistirma egiliminde. Ancak bu calisma, sikistirilmis benchmarklarin en kirilgan maddeleri korudugunu ortaya koyuyor.

Kaynak: arxiv.org/abs/2608.21382

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları