CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
5 Sep 2026 · 07:05 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.579 5 Eyl 2026 · Cumartesi

Microsoft TailSFT: RL Öncesi SFT’de Filtreleme Yöntemiyle Bardak Performans Artışı

Microsoft araştırmacıları, yapay zeka model eğitiminde kritik bir soruyu gündeme getirdi: Standart Supervised Fine-Tuning (SFT) ardışık düzeninin, üzerinde Reinforcement Learning (RL) çalıştırılacak…

AiHaber Editör
Editör
3DK

★ Hızlı Özet

  • Microsoft araştırmacıları, yapay zeka model eğitiminde kritik bir soruyu gündeme getirdi: Standart Supervised Fine-Tuning (SFT) ardışık düze…
  • Bu araştırma, büyük dil modellerinin eğitim süreçlerinde SFT ile RL arasındaki geçişin neden beklenen performans artışını sağlayamadığını ortaya koyuyor.
  • Microsoft'un önerdiği TailSFT (Tail Supervised Fine-Tuning) yöntemi, bu soruna oldukça yalın bir çözüm getiriyor.
  • Standart SFT'de eğitim verisindeki her dizi eşit ağırlıkta işleniyor.

Microsoft TailSFT Research - SFT Filtering Method

Microsoft araştırmacıları, yapay zeka model eğitiminde kritik bir soruyu gündeme getirdi: Standart Supervised Fine-Tuning (SFT) ardışık düzeninin, üzerinde Reinforcement Learning (RL) çalıştırılacak olan doğru modeli üretip üretmediğini sorguluyor. Yanıtları hayır oldu ve bu yanıttan yola çıkarak geliştirdikleri TailSFT yöntemiyle yapay zeka alanında önemli bir ilerleme kaydettiler.

Bu araştırma, büyük dil modellerinin eğitim süreçlerinde SFT ile RL arasındaki geçişin neden beklenen performans artışını sağlayamadığını ortaya koyuyor. Standart SFT yaklaşımında model, halihazırda öğrenmiş olduğu diziler üzerinde gereksiz yere gradient güncellemesi yapmaya devam ediyor; bu durum ise RL’in sonradan keşfetmesi gereken dağılımı daraltıyor.

TailSFT Yöntemi: Standart SFT’den Farkı

Microsoft’un önerdiği TailSFT (Tail Supervised Fine-Tuning) yöntemi, bu soruna oldukça yalın bir çözüm getiriyor. Yaklaşımın temelinde, modelin zaten başarılı olduğu dizileri eğitim sürecinden çıkarmak ve öğrenmenin alt model tarafından temsil edilen kısımlarına yoğunlaşmak yer alıyor.

Standart SFT’de eğitim verisindeki her dizi eşit ağırlıkta işleniyor. Ancak bir süre sonra model bu dizilerin büyük çoğunluğunu zaten öğrendiyor ve bu diziler üzerindeki gradient güncellemeleri durma noktasına geliyor. Bu da RL için kritik olan keşfetme alanının daralmasına yol açıyor.

Benchmark Sonuçları: Kodlama ve Matematik

TailSFT’nin etkisi, özellikle OLMo-3 7B modeli üzerinde yapılan deneylerde açıkça görülüyor. Elde edilen PASS@16 sonuçları, yöntemin ne denli etkili olduğunu ortaya koyuyor:

  • Kodlama: PASS@16’da 16,8 puan mutlak iyileştirme
  • Matematik: PASS@16’da 3,1 puan mutlak iyileştirme

Bu yüksek kapsamlı kontrol noktaları, GRPO sonrası final PASS@1 sonuçlarını da artırıyor — bazı ayarlarda 3,9 puana kadar ek iyileşme gözlemleniyor. Araştırmacılar, erken reward’ın standart SFT çalışmasına kıyasla 2,5 kat daha hızlı yükseldiğini de raporladı.

Neden Önemli?

Bu araştırma, büyük dil modellerinin eğitim boru hatlarında SFT-RL geçişinin neden beklenen sonuçları vermediğine dair somut bir açıklama sunuyor. Standart SFT’nin modelin zaten öğrendiği içeriklere takılı kalması, RL’in ihtiyaç duyduğu keşfetme alanını sistematik olarak daraltıyor.

TailSFT yaklaşımı ise bu sorunu minimal bir müdahaleyle çözüyor: Yapılan tek değişiklik, modelin halihazırda öğrendiği dizileri eğitimden filtrelemek. Bu basit ama etkili strateji, modelin öğrenme kapasitesini daha verimli kullanmasını sağlıyor.

Araştırma, SFT’nin doğasına ilişkin daha derin bir anlayış sunması açısından da değerli. Model eğitiminde veri filtreleme stratejilerinin önemi bir kez daha ön plana çıkıyor.

Teknik Detaylar ve Sonuç

Microsoft’un bu çalışması, standart SFT ardışık düzenlerinin RL için optimize edilmiş modeller üretip üretmediğini sorgulayarak alanda kritik bir boşluğu dolduruyor. Elde edilen sonuçlar, veri filtrelemenin model performansı üzerindeki dramatik etkisini gözler önüne seriyor.

Özellikle kodlama görevlerinde kaydedilen %16,8 oranındaki PASS@16 iyileştirmesi, bu yaklaşımın pratik uygulamalar için büyük potansiyel taşıdığını gösteriyor. TailSFT, mevcut eğitim boru hatlarına minimum değişiklikle entegre edilebilecek şekilde tasarlanmış olmasıyla da dikkat çekiyor.

Not: İlgili papera ve detaylı tartışmaya arXiv üzerinden erişilebilir.

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları