CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
12 Aug 2026 · 22:17 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #1.058 12 Ağu 2026 · Çarşamba

Microsoft Research: Frontier Yapay Zeka Modelleri 41 Dilde Yuzde 71 Oranında Tutarlılık Koruyor

Ne oldu? Microsoft Research, yapay zeka ajanlarının farklı dillerdeki görevlerde ne kadar tutarlı davrandığını ölçen kapsamlı bir çalışma yayımladı.

AiHaber Editör
Editör
3DK 2OKUMA

★ Hızlı Özet

  • Ne oldu? Microsoft Research, yapay zeka ajanlarının farklı dillerdeki görevlerde ne kadar tutarlı davrandığını ölçen kapsamlı bir çalışma yayımladı.
  • Kim yaptı? Çalışma, Microsoft Research'ten Sourabrata Mukherjee, Kalika Bali ve Sunayana Sitaram tarafından yürütüldü.
  • Nasıl yapıldı? Sekiz farklı model, altı paralel kıyaslama, 41 dil ve toplam 2,38 milyon deneme üzerinden test edildi.
  • geleneksel değerlendirmelerin en büyük eksikliği, yalnızca nihai yanıtları karşılaştırması.

Ne oldu? Microsoft Research, yapay zeka ajanlarının farklı dillerdeki görevlerde ne kadar tutarlı davrandığını ölçen kapsamlı bir çalışma yayımladı. Sonuçlar, frontier modellerin 41 dilde yuzde 71 ile 73 arasında eylem politikası tutarlılığı gösterdiğini ortaya koyuyor.

Kim yaptı? Çalışma, Microsoft Research’ten Sourabrata Mukherjee, Kalika Bali ve Sunayana Sitaram tarafından yürütüldü. Araştırma “Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents” başlığını taşıyor.

Nasıl yapıldı? Sekiz farklı model, altı paralel kıyaslama, 41 dil ve toplam 2,38 milyon deneme üzerinden test edildi. Çalışma, geleneksel değerlendirmelerin yalnızca sonuçları karşılaştırdığını, ancak asıl ölçülmesi gereken şeyin eylem politikası olduğunu savunuyor.

Çok Dilli Ajan Performansında Kritik Bulgular

geleneksel değerlendirmelerin en büyük eksikliği, yalnızca nihai yanıtları karşılaştırması. Oysa eylem trajectory’leri (yol güzergahları) maliyeti, gecikmeyi, hata modlarını ve davranışın denetlenebilirliğini belirliyor. Microsoft Research bu trajectory’leri ölçülebilir hale getirerek yeni bir değerlendirme çerçevesi sunuyor.

Çalışmada beş kritik confounding faktör tespit edildi:

  • Kısa izler daha yüksek puan alıyor
  • Boş izler kusursuz puan alıyor
  • İlgisiz izler şans eseri yuzde 50’den fazla örtüşüyor
  • Fark yeniden uretilebilirlik ile sınırlı kalıyor
  • Aynı soru aynı dilde iki kez sorulduğunda model farklı yanıt veriyor

10 Milyar Parametrenin Altında Çok Dilli Tutarlılık Kırılıyor

Araştırmanın en kritik bulgusu: yaklaşık 10 milyar parametrenin altındaki modellerde diler arası politika tutarlılığı bozuluyor. Daha küçük modeller için farklı dillerdeki performans sıralaması büyük ölçüde bir şans eseri zemininden kaynaklanıyor.

Greedy decoding ile dört farklı frontier modeli normalize edildiğinde, her biri yuzde 71 ile 73 arasında eylem politikası tutarlılığını koruyor. Model kimliği varyansın yalnızca yuzde 5,7’sini açıklıyor.

İngilizce Pivot: Ajanlar Non-İngilizce Görevleri İngilizce’ye Yönlendiriyor

En ilgi çekici bulgu: Yapay zeka ajanları, İngilizce olmayan dillerdeki görevleri doğal olarak İngilizce’ye yönlendiriyor. Bu İngilizce pivot davranışı, nedensel olarak yüklenebilir nitelikte. Dört modelde önceden kayıtlı bir önceden bildirimle doğrulandı ve modeller bu davranıştan açıkça vazgeçmiyor.

İlginç bir şekilde, daha önce çok dilli bir hata ürettiği düşünülen şey aslında bir trace-extraction regex’i (model değil) çıktı. İki çalışma örneği verildiğinde bir modelin ölçülen doğruluğu 26 katına çıktı – ancak okunabilir çıktılardaki doğruluğu hardly değişti.

Yapay Zeka Değerlendirme Yönteminde Devrim

Bu çalışma, yapay zeka ajanlarının çok dilli performansını değerlendirme yöntemimizi kökten değiştirecek potansiyele sahip. Geleneksel kıyaslama yaklaşımları, eylem yörüngelerini göz ardı ederek yanıltıcı sonuçlar uretilebiliyor.

Microsoft Research’in bu bulguları, özellikle yapay zeka ajan platformu geliştiren şirketler için kritik önem taşıyor. Ajansların farklı pazarlarda tutarlı performans gösterebilmesi için yalnızca dil değil, eylem tutarlılığının da ölçülmesi gerekiyor.

Kağıt: arxiv.org/abs/2608.11110

Kaynak: @dair_ai / X

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları