CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
13 Aug 2026 · 01:49 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #1.071 13 Ağu 2026 · Perşembe

Yapay Zeka Ajanları Farklı Dillerde Nasıl Performans Gösteriyor? Microsoft Araştırması

Microsoft Research, yapay zeka ajanlarının çok dilli ortamlarda nasıl performans gösterdiğini inceleyen kapsamlı bir araştırma yayımladı.

AiHaber Editör
Editör
2DK

★ Hızlı Özet

  • Microsoft Research, yapay zeka ajanlarının çok dilli ortamlarda nasıl performans gösterdiğini inceleyen kapsamlı bir araştırma yayımladı.
  • Araştırmanın Kapsamı Çalışma, 8 farklı model, 6 paralel kıyaslama ve 41 dilde toplam 2,38 milyon deneme üzerinden yürütüldü. Araştırmacılar,…
  • Temel Bulgular Normalizasyon sonrasında, dört farklı sınır modelinin her biri diller arasında %71-73 oranında eylem politikasını koruyabildi…
  • Küçük modellerde (10 milyar parametrenin altında) bu tutarlılık bozuluyor.

Microsoft Research, yapay zeka ajanlarının çok dilli ortamlarda nasıl performans gösterdiğini inceleyen kapsamlı bir araştırma yayımladı. “Actions Speak Louder than Words” başlıklı çalışma, yapay zeka çok dilli ajan değerlendirmesi alanında önemli bulgular sunuyor.

Araştırmanın Kapsamı

Çalışma, 8 farklı model, 6 paralel kıyaslama ve 41 dilde toplam 2,38 milyon deneme üzerinden yürütüldü. Araştırmacılar, geleneksel değerlendirme yöntemlerinin yanıltıcı olabileceğini ortaya koydu: mevcut yaklaşımlar yalnızca sonuçları karşılaştırıyor ve ajanın izlediği yolu tamamen göz ardı ediyor.

Temel Bulgular

Normalizasyon sonrasında, dört farklı sınır modelinin her biri diller arasında %71-73 oranında eylem politikasını koruyabildi. Model kimliği, varyansın yalnızca %5,7’sini açıklıyor — bu da dil tutarlılığının modelden bağımsız olarak yapısal olduğunu gösteriyor.

Küçük modellerde (10 milyar parametrenin altında) bu tutarlılık bozuluyor. Küçük modellerin sıralaması büyük ölçüde bir tesadüf zeminine bağlı.

İngilizce Pivot Dili Olarak

En dikkat çekici bulgu: Ajanlar, İngilizce olmayan görevleri İngilizceye yönlendiriyor. Bu pivot davranışı yapısal olarak kritik ve nedensel olarak yüklenebilir durumda. Modeller, buna doğrudan yönlendirilseler bile bu stratejiden vazgeçmiyor.

Ölçüm Hataları Sonuçları Çarpıtabilir

Araştırmacılar, standart değerlendirmelerin beş farklı karıştırıcı faktör nedeniyle başarısız olabileceğini tespit etti: kısa izler daha yüksek puan alıyor, boş izler mükemmel puan veriyor, ilgisiz izler şans eseri yarıdan fazla örtüşüyor. Bu faktörlerin hepsi bir sonucu tersine çevirebilecek güce sahip.

Kaynak: @dair_ai / X | Araştırma Makalesi (arXiv)

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları