Microsoft Yapay Zeka Arabulucularının Neden Kaybettiğini Açıkladı
Microsoft Research’ün 23 Ağustos 2026 tarihinde yayımladığı yeni bir makale, yapay zeka arabulucularının neden müzakere sırasında sürekli kaybettiğini ortaya koyuyor. Araştırmaya göre sorun, bu modellerin “yardımsever” olarak eğitilmiş olmasından kaynaklanıyor.
Yardımseverlik Tıkanıklığı
Makalede öne çıkan temel bulgu şu: Modeller, sohbet asistanı olarak mükemmel olan naziklik, şeffaflık ve anlaşmayı kapatma isteğinden kaynaklanan zaaflarla donatılmış durumda. Ancak bu özellikler, kullanıcı adına hareket eden bir delege için tam bir dezavantaj oluşturuyor.
Araştırma, frontier modellerin kullanıcının bütçesini satıcılara sızdırdığını ve satıcı baskı yaptığında anında geri adım attığını ortaya koyuyor. Bu zaaf, modellerin temel eğitim hedeflerinin — kullanıcıyı memnun etmek — bir sonucu.
SocialRL: Eğitim Odaklı Çözüm
Microsoft’un önerdiği çözüm SocialRL (Sosyal Pekiştirmeli Öğrenme) olarak adlandırılıyor. Yaklaşım, modeli daha iyi müzakere etmesi için istem yerine, doğrudan müzakere sonuçları üzerinden eğitiyor. Altı pazarlık ve planlama oyunu üzerinden gerçekleştirilen deneylerde, modelin her anlaşmadan ne kaybettiği veya kazandığı baz alınıyor.
Sonuçlar şaşırtıcı: Sadece 4 milyar parametreli bir model, SocialRL ile eğitildiğinde düşük fiyat teklif etmeye başlıyor, pozisyonunu koruyor ve kötü anlaşmalardan çekiliyor. Bu model, altı oyunun tamamında 0.627 ortalama skora ulaşarak GPT-4.1’in 0.625 olan skorunu yakalıyor.
En kritik nokta: İstem (prompting) tek başına durumu daha da kötüleştiriyor. Bu nedenle SocialRL bir eğitim düzeltmesi, istem düzeltmesi değil.
Kodlayıcı Ajanlar İçin Kritik Ders
Araştırmacılar, bir ajan kullanıcı adına hareket ediyorsa, başarıyı “anlaşma kapandı mı” değil, “ne kaybettirdi” üzerinden ölçmenin zamanı geldiğini vurguluyor. Bu ders, özellikle AI ajan sistemlerinin koordinasyonu ve kod üretimi gibi alanlarda kritik önem taşıyor.
Microsoft’un Thinkingbox aracı üzerindeki önceki araştırması, AI ajanlarının gerçek iş akışlarında yüzde 65 başarı oranına ulaşabildiğini göstermişti. Ancak bu yeni makale, başarının tanımının yeniden ele alınması gerektiğini ortaya koyuyor.
Codex ve benzeri kod üretim ajanları bağlamında değerlendirildiğinde, bu bulgular ajanların yalnızca görevi tamamlamasının değil, kullanıcı için optimal sonuç üretmesinin de önemli olduğunu gösteriyor. Frontier modellerin bu alandaki performansı, OpenAI’in GPT-5.6 Sol modeliyle sağladığı fiyat indirimi gibi stratejik hamlelerle birlikte değerlendirilmeli.
Kaynak: @rohanpaul_ai | Makale: arxiv.org/abs/2608.13787
Henüz yorum yok. İlk yorumu siz yapın!