Atomic Chat, DeepSeek-V4-Flash-0731 modelinin yerel çalıştırma için hazırlanmış GGUF kuantizasyonlarını Hugging Face üzerinde yayımladı. Paket, kayıpsız BF16 seviyesinden 1 bit civarı seçeneklere uzanan 14 basamaktan oluşuyor ve kalite-boyut dengesine göre ölçülmüş sonuçlarla sunuluyor.
DeepSeek-V4-Flash, 284 milyar parametreli bir mixture-of-experts (MoE) mimarisi. Her tokende yaklaşık 13 milyar parametre aktif hale geliyor. Model 43 katman, 256 yönlendirilmiş uzman (bunlardan 6’sı aktif), bir paylaşımlı uzman, 1 milyon token bağlam penceresi ve 129.280’lik bir sözlük boyutu içeriyor.
Kuantizasyona duyarlı eğitim ne anlama geliyor?
Resmi kontrol noktası kuantizasyona duyarlı şekilde eğitilmiş. Yönlendirilmiş uzman ağırlıkları MXFP4 formatında, modelin geri kalanı ise FP8 veya BF16 olarak saklanıyor. Uzman katmanları modelin büyük bölümünü oluşturduğu için, bu yapı yerel kuantizasyon stratejisini doğrudan etkiliyor: uzmanlar zaten yaklaşık 4,25 bit seviyesinde tutulduğundan, daha geniş bir formata yeniden paketlemek ek bilgi kazandırmıyor; yalnızca boyutu artırıyor.
Bu nedenle paketteki AD-BF16 seçeneği “daha yüksek hassasiyetli yeni bir kuant” değil; orijinal ağırlıkların GGUF konteynerine alınmış hali olarak konumlanıyor. Bunun altındaki basamaklar ise uzman bit derinliğini düşürerek boyutu küçültüyor.
14 basamaklı kalite-boyut skalası
Yayımlanan seride boyut aralığı yaklaşık 70 GB ile 162 GB arasında değişiyor. Atomic Chat’in aynı test düzeninde paylaştığı ölçümlerde öne çıkan bazı noktalar şöyle:
- AD-BF16: yaklaşık 162,1 GB — referans, Top-1 eşleşmesi %100
- AD-MXFP4: yaklaşık 154,5 GB — Top-1 eşleşmesi %87,369
- AD-IQ3_S: yaklaşık 130,8 GB — Top-1 eşleşmesi %85,945
- AD-IQ2_M: yaklaşık 104,0 GB — Top-1 eşleşmesi %83,560
- AD-IQ1_M: yaklaşık 70,2 GB — en agresif uçlardan biri
Ölçümlerde perplexity (PPL), ortalama Kullback-Leibler sapması (Mean KLD), Top-1 token eşleşmesi ve güven sapması (Δp RMS) birlikte raporlanıyor. Özellikle Top-1 eşleşmesi, kuantize modelin referansla aynı sonraki tokeni ne sıklıkla seçtiğini gösterdiği için pratik karşılaştırma metriği olarak öne çıkıyor.
128 GB donanım için önerilen nokta
Atomic Chat, 128 GB bellekli sistemlerde deneme için AD-IQ2_M varyantını öne çıkarıyor. Bu basamak yaklaşık 104 GB boyutunda ve paylaşılan ölçümde orijinal modelin token tercihleriyle %83,6 oranında örtüşüyor. Yani en küçük ya da en büyük dosya değil; bellek bütçesine sığarken davranış benzerliğini koruyan orta-alt basamak hedefleniyor.
Modelin kuantizasyona duyarlı eğitilmiş olması nedeniyle, 3 bit altına inildikçe hata artışının klasik BF16 eğitilmiş modellere kıyasla daha hızlı olabileceği de not ediliyor. Bu da “mümkün olan en küçük dosya” yaklaşımının her senaryoda en iyi sonuç vermeyebileceğini gösteriyor.
Yerel kullanım açısından önemi
DeepSeek-V4-Flash-0731’in resmi sürümü agent yeteneklerine vurgu yapan güncel bir kontrol noktası. Yerel topluluk tarafında ise asıl ihtiyaç çoğu zaman ham ağırlıkların ötesinde, donanıma göre seçilebilir ve ölçülmüş kuant setleri oluyor. Atomic Chat’in paketi tam bu boşluğu doldurmayı hedefliyor: tek bir referansa karşı aynı test düzeninde ölçülmüş basamaklar, importance matrix ve yöntem notlarıyla birlikte sunuluyor.
Geliştiriciler ve yerel model kullanıcıları için pratik çıkarım net: donanım belleğine göre basamak seçmek, yalnızca sıkıştırmaya odaklanmaktan daha sağlıklı bir denge sağlıyor. 128 GB sınıfı sistemlerde AD-IQ2_M başlangıç noktası olarak öne çıkarken; daha yüksek bellek bütçesinde IQ3 ailesi veya MXFP4, daha kısıtlı ortamlarda ise IQ2/IQ1 basamakları değerlendirilebilir.
Paket Hugging Face üzerinde AtomicChat/DeepSeek-V4-Flash-0731-GGUF deposunda yer alıyor. Temel model ise deepseek-ai/DeepSeek-V4-Flash-0731 kontrol noktasına dayanıyor.
Henüz yorum yok. İlk yorumu siz yapın!