TailSFT Nedir? Microsoft Yapay Zeka Eğitiminde Çığır Açan Yeni Yöntemini Açıkladı
TailSFT (Filtered Fine-Tuning), Microsoft araştırmacıları tarafından geliştirilen ve standart supervised fine-tuning (SFT) surecindeki temel bir sorunu cozen yeni bir eğitim yaklaşımıdır. Geleneksel SFT, modelin zaten öğrendiği dizilere gradyan harcamaya devam ederek RL’nin keşfetmesi gereken dağılımı daraltıyor.
Standart SFT Neden Yetersiz Kalıyor?
Microsoft araştırma ekibinin temel bulgusuna gore standart SFT, modelin zaten tamamen oğrendiği diziler uzerinde gradyan harcamaya devam ediyor. Bu durum, RL’nin daha sonra keşfetmesi gereken dağılımı daraltıyor ve modelin “kuyruk” bölgesindeki yetersiz ogrenmis kısımlar ihmal edilmiş oluyor.
Bu sorunu gidermek için TailSFT, eğitim sırasında modelin zaten tamamen oğrendiği dizileri filtreliyor. Boylece ogrenme kapasitesi, veri dagılımının yetersiz modellenmis bolgelerine —yani “kuyruğa”— yonlendiriliyor.
TailSFT Performans Sonucları: Kodlama ve Matematikte Buyuk Sıçrama
TailSFT’nin etkisi oldukca carpıcı. OLMo-3 7B modeli uzerinde yapılan testlerde kodlama gorevlerinde pass@16 performansı 16,8 puan mutlak iyilesme gosterdi. Matematik gorevlerinde ise 3,1 puan arts saglandı. GRPO takviyeli ogrenme sonrasında final pass@1 3,9 puan daha yukseldi. Bazı ayarlarda erken odul 2,5 kat daha hızlı yukseldi.
Sıfır Hatalı Tasarım: FPGA’da Ilk Tasarım
Araştırmacılar, bu yaklasımın yalnızca RL sonuclarını iyilestirmediğini, aynı zamanda tasarım kalitesini de artırdığını vurguluyor. FPGA’ya gonderilen ilk tasarım sıfır hata ile calıstı; her blok yuzde 95 kapsama oranına ulashtı. Bu yaklasım, Redwood AI yongasının sadece iki hafta icinde tasarlanmasında kritik rol oynadı.
RL Eğitimi İcin Daha Iyi Baslangıc Noktası
TailSFT’nin en onemli katkılarından biri, uretilen kontrol noktalarının RL eğitimi için daha yuksek kapsama sunmasıdır. Daha iyi baslangıc noktaları, RL’nin odul yuzeyinde daha verimli navigasyon yapmasına olanak tanıyor. Microsoft ekibi, TailSFT’nin hangi ayarlarda en etkili oldugunu belirlemek için hafif bir tanı aracı da gelistirdi.
Yapay Zeka Eğitim Geleceği
TailSFT, buyuk dil modellerinin eğitim sureclerinde temel bir yeniden dusunme sunuyor. Modelin neyi bildiğini değil, neyi henuz yeterince ogrenmediğini on plana cıkaran bu yaklasım, hem eğitim verimliliğini artırıyor hem de sonraki RL asamalari için daha guclu bir temel olusturuyor.
Kaynak: arxiv.org/abs/2608.25756
Henüz yorum yok. İlk yorumu siz yapın!