Tencent, bugün Hunyuan Hy4 Preview modelini Apache 2.0 lisansıyla açık kaynak olarak yayınladı. Bu hamle, Çin’li teknoloji devlerinin yapay zeka alanındaki rekabetini yeni bir boyuta taşırken, Hy4’ün teknik özellikleri de sektörde büyük yankı uyandırdı.
Hy4 Preview, toplam 770 milyar parametreye sahip ve her token başına 49 milyar parametre aktive ediyor. Model, 1 milyon token’lik doğal bağlam penceresiyle donatılmış durumda. Tencent, hem orijinal ağırlıkları hem de FP8 formatındaki ağırlıkları toplulukla paylaştı.
Hy4 Preview: Tencent’in Yeni Amiral Gemisi
Hy4 Preview, Tencent Hunyuan ekibinin şimdiye kadar sunduğu en güçlü yapay zeka modeli olarak öne çıkıyor. 770 milyar parametrelik devasa ölçeği, 49 milyar aktivasyon parametresiyle birleşerek hem yüksek kapasite hem de verimli hesaplama sunuyor.
Modelin en dikkat çekici özelliklerinden biri 1 milyon tokenlik doğal bağlam desteği. Bu, uzun belgeler, kod tabanları ve karmaşık çok dönüşümlü sohbetler için önemli bir avantaj sağlıyor. Tencent, FP8 quantize ağırlıkları da açık kaynak paketiyle birlikte sunarak düşük donanımlı ortamlarda çalıştırmayı mümkün kılıyor.
Apache 2.0 lisansı, modelin ticari kullanımda herhangi bir kısıtlama olmaksızın kullanılabileceği anlamına geliyor. Bu karar, GLM-5.3 ve Kimi K3 gibi diğer Çinli yapay zeka modellerinin açık kaynak stratejileriyle de paralellik taşıyor.
Mimari: MoE, MTP ve Derin Çözümleme
Hy4 mimarisi, Mixture of Experts (MoE) yaklaşımını son derece agresif biçimde benimsiyor. 78 katmanın 77’sinde MoE yapısı kullanılıyor. Her katmanda 256 yönlendirme uzmanı (routing expert) ve 1 paylaşımlı uzman (shared expert) bulunuyor. Her token için Top-8 uzman aktive ediliyor.
Dikkat mekanizmasında Gated DSA (Dynamic Sparse Attention) ve IndexCache teknolojileri kullanılıyor. Kalıntı yollar için iHC (improved Hierarchical Cache) tercih edilirken, MTP (Multi-Token Prediction) ile spekülatif kodlama çözümü sunuluyor.
Tencent, teknik belgelerinde bu dikkat mimarisinin DeepSeek ve GLM modellerinden ilham aldığını açıkça belirtiyor. Bu, Çinli yapay zeka araştırma ekosistemindeki fikir paylaşımının ne denli yoğun olduğunu gösteriyor.
Benchmark Sonuçları: GLM-5.3 ve Kimi K3’ü Geride Bıraktı
Tencent, Hy4 Preview’ün performansını bağımsız değerlendirmelerle destekliyor. Şirket, 163 iç uzmanla 203 gerçek mühendislik görevi üzerinde kör test gerçekleştirdi. Sonuçlar, Hy4 Preview’ün 2.99/4 ortalama puan aldığını ortaya koydu. Bu skor, GLM-5.3‘ün 2.92 ve Kimi K3‘ün 2.94 puanının üzerinde yer alıyor.
Benchmark setleri, modelin gerçek dünya mühendislik senaryolarına odaklandığını gösteriyor: Terminal Bench, DeepSWE, Toolathlon, APEX-Agents ve PostTrainBench gibi zorlu testlerden oluşuyor. Bu setler, özellikle kodlama, ajan tabanlı görevler ve gerçek iş akışı yeteneklerini ölçüyor.
Tencent, modelin erken bir sürüm olduğunu ve bilinen bazı sınırlılıklar bulunduğunu da belirtiyor. Bunlar arasında karmaşık görevlerde aşırı düşünme süresi ve modelin kendi çalışmasını aşırı doğrulama eğilimi yer alıyor.
Açık Kaynak Stratejisi ve Gelecek
Hy4 Preview ile birlikte Tencent, Çin’li yapay zeka devleri arasındaki açık kaynak yarışında önemli bir hamle yapmış oldu. 770 milyar parametreli devasa modelin FP8 ağırlıklarıyla birlikte toplulukla paylaşılması, hem araştırmacılar hem de geliştiriciler için yeni kapılar açıyor.
Bu gelişme, Çin yapay zeka ekosistemindeki genel trende de uygun düşüyor: aşırı büyük MoE modeller, düşük aktivasyon parametreleri, milyon token bağlam pencereleri ve Coding, Agent ve gerçek iş akışı yeteneklerine öncelik veren bir strateji. Hy4 Preview, bu stratejinin en güncel ve en iddialı örneği olarak karşımızda.
Model artık HuggingFace ve GitHub üzerinden indirilebilir durumda. Tencent, topluluk geri bildirimlerine dayalı iyileştirmelerle modelin daha kararlı sürümlerini sunmayı planlıyor.
Henüz yorum yok. İlk yorumu siz yapın!