Ne oldu? Microsoft Research, yapay zeka ajanlarının farklı dillerdeki görevlerde ne kadar tutarlı davrandığını ölçen kapsamlı bir çalışma yayımladı. Sonuçlar, frontier modellerin 41 dilde yuzde 71 ile 73 arasında eylem politikası tutarlılığı gösterdiğini ortaya koyuyor.
Kim yaptı? Çalışma, Microsoft Research’ten Sourabrata Mukherjee, Kalika Bali ve Sunayana Sitaram tarafından yürütüldü. Araştırma “Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents” başlığını taşıyor.
Nasıl yapıldı? Sekiz farklı model, altı paralel kıyaslama, 41 dil ve toplam 2,38 milyon deneme üzerinden test edildi. Çalışma, geleneksel değerlendirmelerin yalnızca sonuçları karşılaştırdığını, ancak asıl ölçülmesi gereken şeyin eylem politikası olduğunu savunuyor.
Çok Dilli Ajan Performansında Kritik Bulgular
geleneksel değerlendirmelerin en büyük eksikliği, yalnızca nihai yanıtları karşılaştırması. Oysa eylem trajectory’leri (yol güzergahları) maliyeti, gecikmeyi, hata modlarını ve davranışın denetlenebilirliğini belirliyor. Microsoft Research bu trajectory’leri ölçülebilir hale getirerek yeni bir değerlendirme çerçevesi sunuyor.
Çalışmada beş kritik confounding faktör tespit edildi:
- Kısa izler daha yüksek puan alıyor
- Boş izler kusursuz puan alıyor
- İlgisiz izler şans eseri yuzde 50’den fazla örtüşüyor
- Fark yeniden uretilebilirlik ile sınırlı kalıyor
- Aynı soru aynı dilde iki kez sorulduğunda model farklı yanıt veriyor
10 Milyar Parametrenin Altında Çok Dilli Tutarlılık Kırılıyor
Araştırmanın en kritik bulgusu: yaklaşık 10 milyar parametrenin altındaki modellerde diler arası politika tutarlılığı bozuluyor. Daha küçük modeller için farklı dillerdeki performans sıralaması büyük ölçüde bir şans eseri zemininden kaynaklanıyor.
Greedy decoding ile dört farklı frontier modeli normalize edildiğinde, her biri yuzde 71 ile 73 arasında eylem politikası tutarlılığını koruyor. Model kimliği varyansın yalnızca yuzde 5,7’sini açıklıyor.
İngilizce Pivot: Ajanlar Non-İngilizce Görevleri İngilizce’ye Yönlendiriyor
En ilgi çekici bulgu: Yapay zeka ajanları, İngilizce olmayan dillerdeki görevleri doğal olarak İngilizce’ye yönlendiriyor. Bu İngilizce pivot davranışı, nedensel olarak yüklenebilir nitelikte. Dört modelde önceden kayıtlı bir önceden bildirimle doğrulandı ve modeller bu davranıştan açıkça vazgeçmiyor.
İlginç bir şekilde, daha önce çok dilli bir hata ürettiği düşünülen şey aslında bir trace-extraction regex’i (model değil) çıktı. İki çalışma örneği verildiğinde bir modelin ölçülen doğruluğu 26 katına çıktı – ancak okunabilir çıktılardaki doğruluğu hardly değişti.
Yapay Zeka Değerlendirme Yönteminde Devrim
Bu çalışma, yapay zeka ajanlarının çok dilli performansını değerlendirme yöntemimizi kökten değiştirecek potansiyele sahip. Geleneksel kıyaslama yaklaşımları, eylem yörüngelerini göz ardı ederek yanıltıcı sonuçlar uretilebiliyor.
Microsoft Research’in bu bulguları, özellikle yapay zeka ajan platformu geliştiren şirketler için kritik önem taşıyor. Ajansların farklı pazarlarda tutarlı performans gösterebilmesi için yalnızca dil değil, eylem tutarlılığının da ölçülmesi gerekiyor.
Kağıt: arxiv.org/abs/2608.11110
Kaynak: @dair_ai / X
Henüz yorum yok. İlk yorumu siz yapın!