Açık kaynak ince ayar aracı Unsloth, dil modellerini karar modellerine dönüştürmek için yeni bir eğitim akışı yayınladı. Karar modeli metin üretmiyor. Girdiyi okuyor, geliştiricinin verdiği seçenekleri puanlıyor ve bir olasılıkla birlikte seçim döndürüyor. Unsloth’un dokümantasyonuna göre bu akışla Jev, Laya ve Cloudflare’in Clef’i gibi karar modellerine benzer modeller eğitilebiliyor. Mevcut karar modellerinin üzerine ek ince ayar yapmak da mümkün. Benzer tipli karar yaklaşımı son günlerde OpenAI’ın Decisions API’sinde ve Liquid AI’ın d1 modellerinde de görüldü.
Sonuçlar
Unsloth, modelleri Clef ile aynı tasarımdaki bir karar başlığı (head) ve LoRA ile ince ayardan geçirdi. Şirkete göre doğruluk, şans seviyesine yakın olan yüzde 30–37’den yüzde 78’e kadar çıktı. Qwen3.5-0.8B’de typed-decisions testinde doğruluk yüzde 36’dan 73’e, BANKING77’de yüzde 7’den 74’e, CLINC150’de yüzde 19’dan 76’ya yükseldi. Ayrılmış test setinde doğruluk yüzde 78 oldu. Qwen3.5-2B’de ayrılmış test doğruluğu yüzde 81.
Dokümantasyondaki tabloya göre eğitim maliyetleri de makul. Qwen3.5-0.8B 4 GB VRAM ile 42 dakikada, Qwen3.5-2B 8 GB ile 40 dakikada, Llama 3.2 3B 4,1 GB ile 30 dakikada yüzde 79’a, Gemma 4 E4B 14,4 GB ile 49 dakikada yüzde 77’ye ulaştı. Laya’ya ek ince ayar 2,5 GB ile 10 dakika sürdü. Eğitimde ag_news, arc, banking77, boolq, clinc150, commonsense_qa, mmlu, mnli, prompt_injections, snli, sst5 ve wanli olmak üzere 12 kaynak ile typed-decisions veri seti kullanıldı. 3.000 satırlık test seti; typed-decisions’tan 2.000, BANKING77 ve CLINC150’den 500’er satırdan oluşuyor. Unsloth, test setlerinin eğitim verisine karşı temizlendiğini belirtiyor.
Nasıl eğitiliyor?
En kolay yol macOS, Windows ve Linux’ta çalışan Unsloth Desktop uygulaması. Kullanıcı Train sekmesinde bir model seçiyor, örneğin unsloth/Qwen3.5-4B, ve eğitim türünü “Decision model” olarak işaretliyor. Ardından bir dosya yüklüyor ya da Hugging Face’ten veri seti seçip eğitimi başlatıyor. Unsloth, eğitim öncesi ve sonrası doğruluğu raporluyor ve modelin güven değerlerini kalibre ediyor. Kod yazmak isteyenler için FastDecisionModel ve DecisionTrainer sınıfları sunuluyor. Llama ya da Gemma 4 kullanmak için yalnızca model adını değiştirmek yetiyor.
Önerilen ayarlar 4-bit LoRA, rank 16 ve 2e-4 öğrenme oranı. Karar başlığı varsayılan olarak 1e-4 ile eğitiliyor. typed-decisions için 2 epoch kullanıldı. Daha az veriyle 3–4 epoch deneniyor. Hızlı bir deneme için max_steps = 60 önerilen değer. Unsloth’a göre Qwen3.5-4B bu ayarla bir L4 GPU’da 10 dakikada yüzde 76’ya ulaştı.
Nasıl çalışıyor?
Unsloth girdiyi, ardından tüm soruları ve seçeneklerini tek bir isteme koyuyor. Model metni bir kez okuyor. Küçük karar başlığı, modelin her soru ve seçenek üzerindeki çıktısına bakıp tüm seçenekleri puanlıyor ve tüm soruları birlikte karara bağlıyor. Model hiç metin yazmadığı için kelime tahminlerine bellek harcamıyor. Tahmin sırasında 16.384 tokena kadar girdi okunabiliyor. Eğitilen model, Unsloth içindeki Decision API ile sunulabiliyor. Bu API Laya formatında yanıt veriyor ve çalışmak için GPU gerektiriyor. Model ilk istekte yükleniyor, bu da birkaç dakika sürebiliyor.
Kaynak: Unsloth Documentation — Train your own Decision Model with Unsloth
Henüz yorum yok. İlk yorumu siz yapın!