CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
28 Aug 2026 · 11:59 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.313 19 Ağu 2026 · Çarşamba

IBM BenchDrift Arastirmasi: Yapay Zeka Benchmark Puanlari Ne Kadar Guvenilir?

Yapay zeka dunyasi arenasinda sansal bir gelisme yasaniyor. IBM Research'ten bes bilim insaninin yayimladigi yeni bir calisma, buyuk dil modellerinin (LLM) benchmark skorlarinin, sorularin yalnizca…

AiHaber Editör
Editör
2DK 8OKUMA

★ Hızlı Özet

  • Yapay zeka dunyasi arenasinda sansal bir gelisme yasaniyor.
  • IBM Research ekibi, 8 farkli buyuk dil modelini GSM8K, MMLU ve MATH-Hard olmak uzere uc farkli benchmark uzerinde test etti.
  • Elde edilen sonuclar, mevcut benchmark sistemlerinin guvenilirligi konusunda ciddi soru isaretleri ortaya cikariyor.
  • Arastirmanin en sansasional bulgusu: Guclu modeller, zayif modellere kiyasla yazim degisikliklerine daha duyarli hale geliyor.

IBM BenchDrift arastirmasi - yapay zeka benchmark

Yapay zeka dunyasi arenasinda sansal bir gelisme yasaniyor. IBM Research’ten bes bilim insaninin yayimladigi yeni bir calisma, buyuk dil modellerinin (LLM) benchmark skorlarinin, sorularin yalnizca farkli sekilde ifade edilmesiyle 74.7 puana kadar degisebilecegini ortaya koydu. Arastirma, “The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance” basligiyla yayinlandi ve alanda buyuk yanki uyandirdi.

Arastirma Nasil Yurutuldu?

IBM Research ekibi, 8 farkli buyuk dil modelini GSM8K, MMLU ve MATH-Hard olmak uzere uc farkli benchmark uzerinde test etti. Calismada “BenchDrift” adli bir denetim cercevesi kullanildi. Bu cerceve, ayni soruyu anlamini koruyarak dort farkli eksende yeniden ifade etti: linguistik, referanssal, edimsel ve yapisal degisiklikler.

Elde edilen sonuclar, mevcut benchmark sistemlerinin guvenilirligi konusunda ciddi soru isaretleri ortaya cikariyor. Bir modelin belirli bir yazim tarziyla basarili olmasi, diger yazimlarda da basarili olacagi anlamina gelmiyor. Aksine, model iyilestikce kelime secimine olan hassasiyet azalmiyor; yon degistiriyor.

Gucune Gore Hassasiyet Artiyor

Arastirmanin en sansasional bulgusu: Guclu modeller, zayif modellere kiyasla yazim degisikliklerine daha duyarli hale geliyor. Zayif modeller yeniden ifade etmeden kazandiklarindan daha fazla dogru cevap kaybediyor. Bu durum, su anda benchmark siralamalarinda en ust siralarda yer alan modellerin skorlarinin, yalnizca o belirli yazim tarzina uygun olabilecegi endisesini doguruyor.

Ornegin, bir modelin 100 soruluk bir testte yuzde 85 basari gostermesi, ayni sorularin farkli sekilde sorulmasi halinde yuzde 40’lara dustugu goruldu. Bu, modelin gercek yetenegini degil, ozel bir yazim tarzina uyumunu olcuyor olabilir.

Guven Skorlari da Yaniltabiliyor

Model guven skorlarinin bu sorunu cozmedigi ortaya cikti. En yuksek guven skorlu cevaplarda bile, yeniden ifade etme islemi yuzde 18.5 oraninda dogru cevaplarin kaybolmasina neden oldu. Ilginc bir sekilde, soruyu hem daha kisa hem de daha uzun yazmak ayni olumsuz etkiyi yaratiyor.

Calismanin yazarlari Shailja Thakur, Sungeun An, Chad DeLuca ve Hima Patel, mevcut benchmark sistemlerinin tek bir yazima dayanmasi nedeniyle yaniltici olabilecegini vurguluyor. Gercek yetenek degerlendirmesi icin birden fazla esdeger yazim kullanilmasi gerektigi veya benchmark siralamalarinda yalnizca puan farklari degil, puan araliklarinin da raporlanmasi gerektigi ifade ediliyor.

Neden Bu Bulgu Onemli?

AI haberleri kapsaminda belirttigimiz uzere, yapay zeka dunyasinda model secimi genellikle kucuk skor farklarina dayaniyor. Bu calisma, ogrenim yanliliginin model yetkinliginden kaynaklanabilecegini gosteriyor. Yapay zeka benchmark sistemlerinin yeniden dusunulmesi gerektigi mesaji, hem arastirmacilar hem de uygulayicilar icin kritik bir uyari niteliginde.

Kaynak: arxiv.org/abs/2608.11694

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları