Cin yapay zeka sirketi Zhipu AI, haftalardir AI toplulugunu mesgul eden gizemli Ox Alpha modelinin aslinda GLM-5.3-Flash oldugunu resmen dovruladi. Bu aciklama, Oxford Universitesi arastirmacilarinin Java stack trace analiziyle ortaya koydugu kanitlari da dogrulammis oldu.
100 Trilyon Token Gunluk Kapasite: NVIDIA Degil, Cin Cipleri
Aciklama ile birlikte dikkat cekici bir gercel daha gun yuzune cikti: Son birkac gunde gunluk 100 trilyon token isleyen devasa gizli trafik kapasitesi, NVIDIA GPU kumesi uzerinde degil, on binlerce Cin yapay zeka hizlandiricisi ve Cin yapimi ciplerle calisiyordu. Bu durum, Cin’in yuksek performansli yapay zeka altyapisindaki bagimsizligini bir kez daha ortaya koydu.
GLM-5.3-Flash Teknik Ozellikleri
GLM-5.3-Flash, toplamda 320 milyar parametreye sahip olmasina ragmen, cikirim sirasinda yalnizca 18 milyar parametre aktive ediyor. Bu Mixture-of-Experts (MoE) mimarisi, maliyet verimliligini dramatik sekilde artiriyor. Onceki nesil GLM-4.5’te 92 katman kullanilirken, yeni modelde bu sayi 45’e dusurulerek her token icin gereken is yuku yariya indirildi.
Benchmark Sicramalari ve Performans
GLM-5.3-Flash’in performans sicramasi benchmark sonuclarina net yansiyo:
- DeepSWE: 46.2’den 63.4’e yukseldi
- AutomationBench: 26.2’den 48.8’e cikti
Bu sonuclar, modelin kod uretimi ve otomasyon gorevlerinde onceki nesle gore onemli olcu de iyilestigini gosteriyor.
Linear Attention ve IndexPool: Mimari Yenilikler
GLM-5.3-Flash’in en onemli yeniligi, linear attention mekanizmasini sparse attention ile birlestirmesi. Model, ucuz durum takibi icin linear attention kullanirken, yalnizca yeniden ziyaret edilmeye deger uzak baglamlari almak icin hafif bir indexleyici kullaniyor. Bu tasarim, 1 milyon token penceresi boyunca tam attention harcamak yerine dikkat hesaplamasini 3 kat, katman basina KV onbellekini ise 4.4 kat azaltiyor.
IndexPool teknolojisi, dort indexleyici anahtar vektorunu tek bir vektorde sikistirarak bellek verimliligi artiriyor. Kullanicilar bu modeli GLM-5.3-Flash’in resmi duyurusunda detayli sekilde inceleyebilir.
Fiyat Performans Rekoru: GLM-5.2’nin 10’da 1 Maliyeti
GLM-5.3-Flash, yalnizca 18 milyar aktif parametreyle GLM-5.2’nin 10’da 1 fiyatina sunuluyor. Bu, modelin hem maliyet hem de performans acisindan en verimli Cin yapay zeka modellerinden biri oldugu anlamina geliyor. Ox Alpha’nin Zhipu AI tarafindan resmi olarak dogrulanmasi surencini takip edenler icin bu gelisme supriz oljadi.
Cin Acik Kaynak Yapay Zeka Ekosistemi Icin Donum Noktasi
Bu lansman, Cin’in acik kaynak yapay zeka alanindaki liderligini pekistiriyor. GLM-5.3-Flash’in ayni gun Qwen3.8-Flash-Next ile birlikte acik kaynak olarak yayinlanmasi, Cin yapay zeka toplulugu icin tarihi bir gun olarak degerlendiriliyor.
Henüz yorum yok. İlk yorumu siz yapın!