DeepSeek V4 Pro 0813 modelinin Hugging Face’e yüklenen açık kaynak versiyonu ile ilgili çarpıcı bir sorun ortaya çıktı. Model, piyasaya sürülen Pro sürümü yerine Flash mimarisi ile yayınlandı ve durum ancak topluluk tarafından fark edildi.
Olay, yapay zeka dünyasında hem teknik bir gariplik hem de büyük bir şirketin ürün lansmanındaki özensizliği gözler önüne serdi. DeepSeek, 1,6 trilyon parametreli amiral gemisi modelini yayınladı — ancak açık kaynak versiyonu yanlış yapılandırmayla geldi.
Yanlis Yapilandirma Nasil Fark Edildi?
Topluluk, DeepSeek’in Hugging Face’e yüklediği V4-Pro-0813 deposunu incelerken beklenmedik bir tutarsızlık keşfetti. Modelin mimari parametreleri, beklenen Pro özellikleri yerine V4 Flash ile tamamen örtüşüyordu:
- Hidden size: 4096 (Flash ile uyumlu, Pro olması gereken: 7168)
- Katman sayisi: 43 (Flash ile uyumlu, Pro olması gereken: 61)
- Routed experts: 256 (Flash ile uyumlu, Pro olması gereken: 384)
- Attention heads: 64 (Flash ile uyumlu, Pro olması gereken: 128)
DeepSeek’in Tepkisi: Yapilandirma Dosyasi Degistirildi
Durum topluluk tarafından fark edilir edilmez, Hugging Face üzerindeki V4-Pro-0813 deposu geçici olarak kaldırıldı. Ardından DeepSeek, modeli yeniden yükledi — bu kez config dosyası doğru Pro mimarisiyle güncellenmişti.
Ancak hikâye burada bitmedi. Commit geçmişini inceleyen geliştiriciler, yalnızca yapılandırma dosyasının değil, bazi safetensors ağırlık dosyalarının SHA256 hash değerlerinin ve dosya boyutlarının da değiştiğini tespit etti.
Bu Ne Anlama Geliyor?
Yapılandırma dosyasını yanlış yüklemek basit bir hata olarak görülebilir. Ancak ağırlık dosyalarının da değişmesi, DeepSeek’in yalnızca bir config dosyasını düzeltmediğini, checkpoint’leri yeniden işlediğini, export ettiğini veya kısmen quantize ettiğini gösteriyor.
Bu da şu soruyu gündeme getiriyor: Model, ilk yayınlandığında aslında tam Pro özelliklerine sahip miydi, yoksa Flash olarak mı yayınlandı ve sonradan mı düzeltildi?
Yapay Zeka Dunyasinda Buyuk Bir Gercek
Bir kullanıcının ifadesiyle: “Modeli eğitmek başarılabilir, ancak yayınlamayı başaramamak dünyada büyük bir çelişki.”
Bu olay, yapay zeka şirketlerinin ürün lansmanlarındaki özensizliği bir kez daha gözler önüne serdi. Büyük dil modellerinin geliştirilmesi kadar dağıtım süreçlerinin de kritik olduğu, bu tür hataların topluluk güvenini sarsabileceği açık.
Sonuç olarak, V4 Pro 0813’ün ilk günkü performans testlerinin artık yeniden değerlendirilmesi gerektiği düşünülüyor. Model, yanlış yapılandırma nedeniyle muhtemelen Pro kapasitesinin altında çalışıyordu.
Henüz yorum yok. İlk yorumu siz yapın!