Microsoft Research, yapay zeka model eğitiminde onemli bir keşif yapti. Standart Supervised Fine-Tuning (SFT) yonteminin, sinir ağlarının zaten oğrendigi dizilere gereksiz yere gradient harcadigini ve bunun model performansini sinirlandirdigini ortaya cikardi. TailSFT (Filtered Fine-Tuning) adi verilen yeni yontem ise bu sorunu kökten cozuyor.
Standart SFT’nin Gizli Sorunu
Geleneksel supervised fine-tuning, modeli eğitirken tüm veri dizilerine esit sekilde yaklasiyor. Ancak model zaten belirli dizileri ogrenmis oldugunda, bu dizilere ayrılan gradient guncellemeleri modelin yeni ve zor verilere odaklanma kapasitesini kisitliyor.
Microsoft Research ekibi, standart SFT’nin orijinal modelden devralinan onceden ogrenmis bilgiler uzerine gereksiz yere gradient harcamaya devam ettigini fark etti. Bu durum, reinforcement learning (RL) asamasinda modelin keşfetmesi gereken dagilimi daraltiyor.
TailSFT Nasil Calisiyor?
TailSFT (Filtered Fine-Tuning), bu sorunu elegane bir sekilde cozmeyi basariyor. Yontem, modelin zaten iyi ogrendigi dizileri eğitim suresince filtreliyor ve ogrenmenin daha az model uzerinde yogunlastigi ‘kuyruk’ bolumlerine odaklaniyor.
Bu degisiklik, minimal bilgisalayarlama yuku ile birlikte geliyor ancak modelin genel performansini onemli olcude artiriyor.
Teknik Sonuclar: OLMo-3 7B Uzerinde Test
TailSFT, OLMo-3 7B modeli uzerinde kapsamli testlerden gecti:
- Kodlama basarisinda: pass@16 metriginde 16.8 puan mutlak iyilesme
- Matematik performansinda: pass@16’da 3.1 puan mutlak iyilesme
- GRPO sonrasi: Final pass@1’de 3.9 puan mutlak iyilesme
- Bazi ayarlarda: Erken donem odul 2.5 kat daha hizli yukseldi
Evre-Bilincli AI Gelistirme Yaklasimi
Araştırmacılar, bulgularinin ‘evre-bilincli’ (stage-aware) bir AI gelistirme yaklasimini destekledigini vurguluyor. Buna gore, aradaki eğitim kontrolnoktalarinin degeri, bir sonraki eğitim evresini ne kadar iyi destekledikleriyle olculmeli.
Reinforcement Learning Iliskisi
TailSFT’nin en onemli katkılarından biri, reinforcement learning (RL) ile SFT arasındaki iliskiyi yeniden dusunmemizi saglamasi. Standart SFT, RL icin optimal bir baslangic noktasi uretmiyor. TailSFT ise RL sonrası performansı onemli olcude artiran daha zengin kontrolnoktalari olusturuyor.
Bu bulgu, ozellikle GRPO (Group Relative Policy Optimization) gibi RL yontemlerinin kullanildigi sistemlerde kritik onem tasıyor.
Sonuç ve Degerlendirme
Microsoft Research’in bu calısması, yapay zeka eğitim sureclerinde ‘daha fazla veri, daha fazla hesaplama’ anlayışının yetersiz kaldigini gosteriyor. TailSFT, mevcut kaynakların daha verimli kullanılmasını saglayarak hem maliyet dusunur hem de performansı artırıyor.
Araştırma, arXiv’de yayimlanan calismanın tamamına erisilebilir durumda.
Kaynak: DAIR.AI (@dair_ai) / X
Henüz yorum yok. İlk yorumu siz yapın!