Microsoft Research’ten Sosyal Muhakeme AI Modeli: 4B SocialRL, GPT-5’i Geride Bıraktı

Microsoft Research, yapay zeka alanında çarpıcı bir çalışmaya imza attı. Araştırmacılar, yalnızca 4 milyar parametreli bir SocialRL modelinin, GPT-5 ailesindeki modelleri sosyal muhakeme görevlerinde geride bırakabildiğini gösterdi. Bu bulgu, büyük dil modellerinin “yardımseverlik” ile “gizlilik” arasındaki temel açmazı ortaya koyuyor. SocialRL araştırması, 6 farklı alanda – müzakere, iş görüşmesi, pazar yeri pazarlığı ve takvim yönetimi gibi görevlerde – küçük bir modelin büyük modelleri nasıl alt edebildiğini gözler önüne seriyor.
SocialRL Nedir ve Nasıl Çalışır?
SocialRL, Microsoft Research tarafından geliştirilen ve sosyal muhakeme becerilerini doğrudan eğiten bir tarif. Geleneksel AI asistanları “yardımsever” ve “sosyal açıdan yetkin” olacak şekilde tasarlanıyor; ancak bu özellikler, kullanıcı adına hareket etmesi gereken bir temsilci (delegate) için ciddi zayıflıklar yaratıyor. SocialRL araştırması tam bu noktada devreye giriyor: model, kullanıcının özel bilgilerini istenmeden ifşa edebiliyor ve ilk direniş işaretinde geri adım atabiliyordu. Sosyal muhakeme becerileri doğrudan 4B ölçekli bir modelde eğitilerek bu açmaz çözüme kavuşturuldu.
Müzakere Oyunlarında Çarpıcı Sonuçlar
Araştırma, altı farklı sosyal muhakeme alanında kapsamlı testler gerçekleştirdi: Deal-or-No-Deal, CaSiNo, Craigslist, iş görüşmesi, takvim yönetimi ve pazar yeri pazarlığı. Her alanda SocialRL ile eğitilmiş 4B model, yalnızca o alanda değil, alan dışı senaryolarda da GPT-5 ailesi modellerine kıyasla üstün performans sergiledi. Müzakere oyunlarında, temel modelden en iyi modele kadar olan boşluğun yüzde 73 ila 122’si kapatılarak, küçük bir modelin büyük modelleri nasıl yakalayabildiği gösterildi. Alıcı açılışlarının yüzde 78’i hedefin altında anchoring yaptı; eğitimsiz modelde bu oran yalnızca yüzde 3’te kaldı.
Cascade RL ve Çok Öğretmenli Damıtma Yöntemi
SocialRL araştırmasının en önemli teknik katkılarından biri, “cascade RL” (basamaklı pekiştirmeli öğrenme) ve “çok öğretmenli sıralı damıtma” (multi-teacher on-policy distillation – OPD) yöntemlerinin kullanılması oldu. Her alanda uzmanlaşmış ayrı modeller, bu iki stratejiyle tek bir birleşik 4B modelde birleştirildi. Bu yaklaşım, alan bazlı uzmanlık ile genel muhakeme gücünü bir arada sunan bir model ortaya çıkardı. Theory-of-Mind (Zihin Kuramı) iskelesi de yalnızca eylemler değil, muhakeme izleri de damıtılarak modelin her ortamda faydasını artırdı ve çapraz ortam genellemesini güçlendirdi.
GPT-5 Ailesiyle Karşılaştırma: Rakamlar Ne Diyor?
Birleşik 4B SocialRL modeli, altı ortamda ortalama 0,627 fayda puanına ulaştı. Bu sonuç, GPT-4.1’in (0,625), GPT-5.1’in (0,619) ve GPT-5.2’nin (0,613) önünde yer alıyor. Araştırmacılar, sonraki eylem tahmininin (next-action prediction) muhakeme izlerinden yalnızca hareket damıtmaya kıyasla daha iyi sonuç verdiğini ve yalnızca bu becerinin müzakere sonuçlarını tahmin edebildiğini tespit etti. Bu bulgu, AI asistanlarının eğitiminde yalnızca sonuç odaklı yaklaşımların değil, muhakeme süreçlerinin de kritik önem taşıdığını ortaya koyuyor.
AI Asistanlarının Açmazı: Yardımseverlik ve Gizlilik Çelişkisi
SocialRL araştırmasının en çarpıcı tespitlerinden biri, mevcut asistanların doğasındaki çelişkiyi gözler önüne sermesi. Yardımsever, samimi ve sosyal açıdan yetkin bir asistan, aynı zamanda kötü bir temsilcidir. Araştırmacılar, dostça bir frontier modelinin, kullanıcının özel bilgilerini spontan olarak ifşa ettiğini ve ilk direniş işaretinde geri adım attığını gözlemledi. Bu, günümüz AI asistanlarının kullanıcı adına gerçek anlamda etkili bir şekilde hareket etmesini engelleyen temel bir sorun. SocialRL, bu açmazı sosyal muhakeme becerilerini doğrudan eğitim sürecine entegre ederek çözüme kavuşturuyor.
Sonuç ve gelecek Perspektifi
Microsoft Research’ün SocialRL çalışması, yapay zeka alanında küçük modellerin büyük modellerle rekabet edebileceğini gösteren önemli bir kilometre taşı. 4 milyar parametreli bir modelin GPT-5 ailesini alt etmesi, hem verimlilik hem de performans açısından yeni bir dönemin başlangıcına işaret ediyor. Özellikle müzakere, satış, insan kaynakları ve müşteri hizmetleri gibi sosyal muhakemenin kritik olduğu alanlarda, SocialRL yaklaşımının gelecekte daha geniş uygulama alanları bulması bekleniyor. Araştırma, yapay zekanın kullanıcı adına hareket ederken hem gizliliği koruyabileceğini hem de etkili bir şekilde müzakere edebileceğini kanıtlıyor. Çalışmanın tamamı arxiv.org adresinde yayımlandı.
Kaynak: DAIR.AI (@dair_ai), X platformu, 17 Ağustos 2026 | arxiv.org/abs/2608.13787
Henüz yorum yok. İlk yorumu siz yapın!