CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
2 Sep 2026 · 00:43 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.552 2 Eyl 2026 · Çarşamba

Microsoft TailSFT: Supervised Fine-Tuning’de Devrim Niteliğinde Arastirma

Microsoft Research, yapay zeka model eğitiminde onemli bir keşif yapti.

AiHaber Editör
Editör
2DK

★ Hızlı Özet

  • Microsoft Research, yapay zeka model eğitiminde onemli bir keşif yapti.
  • Standart SFT'nin Gizli Sorunu Geleneksel supervised fine-tuning, modeli eğitirken tüm veri dizilerine esit sekilde yaklasiyor. Ancak model z…
  • Microsoft Research ekibi, standart SFT'nin orijinal modelden devralinan onceden ogrenmis bilgiler uzerine gereksiz yere gradient harcamaya devam ettigini fark etti.
  • TailSFT Nasil Calisiyor?

Microsoft Research, yapay zeka model eğitiminde onemli bir keşif yapti. Standart Supervised Fine-Tuning (SFT) yonteminin, sinir ağlarının zaten oğrendigi dizilere gereksiz yere gradient harcadigini ve bunun model performansini sinirlandirdigini ortaya cikardi. TailSFT (Filtered Fine-Tuning) adi verilen yeni yontem ise bu sorunu kökten cozuyor.

Standart SFT’nin Gizli Sorunu

Geleneksel supervised fine-tuning, modeli eğitirken tüm veri dizilerine esit sekilde yaklasiyor. Ancak model zaten belirli dizileri ogrenmis oldugunda, bu dizilere ayrılan gradient guncellemeleri modelin yeni ve zor verilere odaklanma kapasitesini kisitliyor.

Microsoft Research ekibi, standart SFT’nin orijinal modelden devralinan onceden ogrenmis bilgiler uzerine gereksiz yere gradient harcamaya devam ettigini fark etti. Bu durum, reinforcement learning (RL) asamasinda modelin keşfetmesi gereken dagilimi daraltiyor.

TailSFT Nasil Calisiyor?

TailSFT (Filtered Fine-Tuning), bu sorunu elegane bir sekilde cozmeyi basariyor. Yontem, modelin zaten iyi ogrendigi dizileri eğitim suresince filtreliyor ve ogrenmenin daha az model uzerinde yogunlastigi ‘kuyruk’ bolumlerine odaklaniyor.

Bu degisiklik, minimal bilgisalayarlama yuku ile birlikte geliyor ancak modelin genel performansini onemli olcude artiriyor.

Teknik Sonuclar: OLMo-3 7B Uzerinde Test

TailSFT, OLMo-3 7B modeli uzerinde kapsamli testlerden gecti:

  • Kodlama basarisinda: pass@16 metriginde 16.8 puan mutlak iyilesme
  • Matematik performansinda: pass@16’da 3.1 puan mutlak iyilesme
  • GRPO sonrasi: Final pass@1’de 3.9 puan mutlak iyilesme
  • Bazi ayarlarda: Erken donem odul 2.5 kat daha hizli yukseldi

Evre-Bilincli AI Gelistirme Yaklasimi

Araştırmacılar, bulgularinin ‘evre-bilincli’ (stage-aware) bir AI gelistirme yaklasimini destekledigini vurguluyor. Buna gore, aradaki eğitim kontrolnoktalarinin degeri, bir sonraki eğitim evresini ne kadar iyi destekledikleriyle olculmeli.

Reinforcement Learning Iliskisi

TailSFT’nin en onemli katkılarından biri, reinforcement learning (RL) ile SFT arasındaki iliskiyi yeniden dusunmemizi saglamasi. Standart SFT, RL icin optimal bir baslangic noktasi uretmiyor. TailSFT ise RL sonrası performansı onemli olcude artiran daha zengin kontrolnoktalari olusturuyor.

Bu bulgu, ozellikle GRPO (Group Relative Policy Optimization) gibi RL yontemlerinin kullanildigi sistemlerde kritik onem tasıyor.

Sonuç ve Degerlendirme

Microsoft Research’in bu calısması, yapay zeka eğitim sureclerinde ‘daha fazla veri, daha fazla hesaplama’ anlayışının yetersiz kaldigini gosteriyor. TailSFT, mevcut kaynakların daha verimli kullanılmasını saglayarak hem maliyet dusunur hem de performansı artırıyor.

Araştırma, arXiv’de yayimlanan calismanın tamamına erisilebilir durumda.

Kaynak: DAIR.AI (@dair_ai) / X

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları