CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
19 Sep 2026 · 06:13 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
AnasayfaRehberlerGeliştiriciKimi K3 – Local’de Nasıl Çalıştırılır
REHBER BAŞLANGIÇ ⏱ 12 dk

Kimi K3 – Local’de Nasıl Çalıştırılır

Kimi K3 Quant’larını Yerel Kurulumda Çalıştırma Rehberi Moonshot AI’nin geliştirdiği Kimi K3, 2.8 trilyon parametreli (104B aktif) açık ağırlıklı bir modeldir. Kodlama, agentic işler, uzun bağlam ve sohbet senaryolarında şu anki en güçlü açık model konumundadır; Claude 4.8 Opus ve GPT-5.6 ile rekabet eder. Yerel görüntü desteği vardır, 1 milyon token’lık bağlam penceresine sahiptir ve […]

AiHaber Editör Yazar · 6 Ağu 2026
Kimi K3 – Local’de Nasıl Çalıştırılır
GELIşTIRICI

Kimi K3 Quant’larını Yerel Kurulumda Çalıştırma Rehberi

Moonshot AI’nin geliştirdiği Kimi K3, 2.8 trilyon parametreli (104B aktif) açık ağırlıklı bir modeldir. Kodlama, agentic işler, uzun bağlam ve sohbet senaryolarında şu anki en güçlü açık model konumundadır; Claude 4.8 Opus ve GPT-5.6 ile rekabet eder. Yerel görüntü desteği vardır, 1 milyon token’lık bağlam penceresine sahiptir ve MXFP4 kullanır.

  • Tam hassasiyetli (full-precision) çıkarım için 1.56 TB depolama gerekir.
  • 1-bit Unsloth Dynamic GGUF versiyonu ise yalnızca 594 GB yer kaplar (%62 daha küçük).

Doğruluk ve boyut karşılaştırması:

  • Dynamic 1-bit: ~%78.9 top-1 doğruluk, %62 daha küçük
  • Dynamic 2-bit (861.3 GB): ~%90 doğruluk, %45 daha küçük

Kimi-K3-GGUF modellerini Unsloth Studio veya llama.cpp ile çalıştırabilirsiniz. Model; NVIDIA DGX Station üzerinde veya 128 GB RAM’li bir cihaza bağlı Mac Studio’da sorunsuz çalışır.

Kayıpsız (lossless) kullanım için Q8 (UD-Q8_K_XL) önerilir. Bu versiyon, Q4 (UD-Q4_K_XL)’ten yaklaşık 50 GB daha büyüktür. Dinamik 1-bit şu an 553.2 GiB seviyesindedir. Modeli bozmadan 512 GiB’nin altına indirme konusunda çalışmalar devam etmektedir.

Kimi K3’ü yerel olarak çalıştırabilir misiniz?

Kimi K3’ün tam sürümünü bir dizüstü bilgisayarda veya tek bir tüketici GPU’sunda çalıştıramazsınız, çünkü 2,8 trilyon parametreli bir model bu donanım için çok büyüktür. Yerel barındırma, kişisel bir makine değil, özel bir çoklu GPU sunucusu anlamına gelir.

Kimi K3 büyük olasılıkla Uzmanlar Karışımı tasarımına sahip, bu nedenle her istekte parametrelerinin yalnızca bir kısmını etkinleştiriyor. Bu, belirteç başına hesaplama yükünü azaltıyor, ancak yine de küme genelinde bellekte tüm ağırlıkları tutmanız gerekiyor, bu da bağlayıcı kısıtlamadır.

Dolayısıyla dürüst cevap şu: Evet, gerçek bir altyapıya sahip bir kuruluş Kimi K3’ü kendi bünyesinde barındırabilir, ancak bir iş istasyonunda çalışan bir birey tam modeli çalıştıramaz. Özel donanım ve mühendislik zamanı gerektiren bir sunucu projesi planlayın.

  • Bu bir dizüstü bilgisayar modeli değil; tüm ağırlıklar için çoklu GPU’lu bir sunucu gerekiyor.
  • MoE, token başına işlem gücünü azaltır ancak tüm ağırlıkları tutmak için gereken belleği azaltmaz.
  • Altyapısı olan kuruluşlar için gerçekçi; tek bir iş istasyonu için değil.

2.8T Modelinin Donanım Gerçekliği

Temel gereksinim, Kimi K3’ün ağırlıklarını aynı anda birçok hızlandırıcıda tutmak için yeterli GPU belleğidir. 2,8 trilyon parametreli bir model bir veya iki GPU’ya sığmaz, bu nedenle kartlar arasında yüksek bant genişliğine sahip bağlantıya sahip, genellikle çok düğümlü, çoklu GPU’lu bir kümeye ihtiyacınız vardır.

GPU sayısını özellikle sabit tutmuyoruz çünkü bu, kullandığınız sayısal hassasiyete, uyguladığınız nicelemeye, bağlam uzunluğunuza ve hedeflediğiniz verimliliğe bağlıdır. Bu seçimler gereksinimi önemli ölçüde değiştirir, bu nedenle genel bir rakam yerine kendi iş yükünüze göre boyutlandırma yapın.

GPU’ların ötesinde, çevredeki sistem için de bütçe ayırın: uzmanların ve katmanların kesintisiz iletişim kurabilmesi için hızlı ağ bağlantısı, ağırlıkları yüklemek için yeterli miktarda ana bilgisayar RAM’i ve hızlı depolama alanı, ayrıca sürekli ağır yük için güç ve soğutma.

  • Belleğe bağlı — tüm ağırlıkların GPU kümesine sığması gerekir.
  • Çoklu GPU, genellikle çoklu düğüm ve yüksek bant genişliğine sahip ara bağlantı.
  • Gerçek sayım, hassasiyete, nicelemeye, bağlama ve veri işleme hızına bağlıdır.
  • Ayrıca ağ bağlantısı, sunucu RAM’i, hızlı depolama, güç ve soğutma da dahil.

Nicelleştirme: Kimi K3’ü Daha Az Donanımla Takmak

Nicelleştirme, Kimi K3’ü daha az donanım üzerinde çalıştırmanın ana kaldıraçlarından biridir. Ağırlıkları daha düşük sayısal hassasiyetle depolayarak bellek kullanımını azaltır ve aynı modelin daha az veya daha küçük GPU’lara sığmasını sağlar.

Burada ödün verilen nokta kalitedir. Agresif niceleme, zorlu görevlerde çıktıyı düşürebilir; bu nedenle hassasiyet seviyesini bedava bir kazanç olarak değil, ayarlanacak bir kadran olarak düşünün. Gerçek komut dosyalarınızı her seviyede test edin ve kalite standardınızı karşılayan en düşük hassasiyet seviyesini koruyun.

Açık ağırlıklar yayınlandıktan sonra topluluk tarafından oluşturulan nicelleştirilmiş sürümleri takip edin. Popüler açık modeller genellikle birkaç hafta içinde Hugging Face’te birkaç nicelleştirilmiş varyant elde eder ve bu da Kimi K3 için giriş donanımını önemli ölçüde düşürebilir.

  • Daha düşük hassasiyet, daha az donanım sığdırmak için bellek alanını küçültür.
  • Aşırı nicelleştirme, zorlu görevlerde kaliteyi olumsuz etkileyebilir.
  • Ayarlamayı yapın — değerlendirmenizden geçebilecek en düşük hassasiyet seviyesini koruyun.
  • Topluluk tarafından oluşturulan ve nicelleştirilmiş sürümler, genellikle yayınlandıktan sonra Hugging Face’te görünür.

Gerçekte Ne Kadar Donanıma İhtiyacınız Var? Hesaplamayı Yapın

Kimi K3’ün boyutunu tek bir hesaplamayla kendiniz belirleyebilirsiniz: Parametre sayısını seçtiğiniz hassasiyetteki parametre başına bayt sayısıyla çarpın, ardından KV önbelleği, aktivasyonlar ve bellek parçalanması için yaklaşık %20 ekleyin. 2,8 trilyon parametre için bu, BF16’da yaklaşık 5,6 TB, FP8’de yaklaşık 2,8 TB ve INT4’te yaklaşık 1,4 TB ağırlık anlamına gelir.

Bu toplamı her hızlandırıcıdaki kullanılabilir belleğe bölerek GPU sayısı için bir alt sınır elde edebilirsiniz. 80 GB’lık kartlarda, ek yükü hesaba kattığınızda, FP8 dağıtımı yaklaşık 40 GPU’ya, yani yaklaşık beş adet 8 GPU’lu düğüme denk gelir ve INT4 bunu yaklaşık olarak yarıya indirir. 141 GB’lık kartlarda aynı FP8 hedefi yaklaşık 24 GPU’ya, 192 GB’lık kartlarda ise yaklaşık 16 GPU’ya düşer.

Buradaki her sayıyı, ağırlıkları tutmak için bir taban değer olarak düşünün, bir verimlilik hedefi olarak değil. KV önbelleği, bağlam uzunluğu ile eşzamanlı istek sayısının çarpımıyla büyür; bu nedenle, uzun bağlamlı, yüksek eşzamanlılıklı bir hizmet, yalnızca ağırlıklardan çok daha fazla belleğe ihtiyaç duyar ve model uygun hale geldiğinde, genellikle saniyede token sayısını sınırlayan şey ham kapasite değil, ara bağlantı bant genişliğidir.

  • Ağırlıklar = parametreler x parametre başına bayt sayısı, artı önbellek ve etkinleştirmeler için yaklaşık %20.
  • 2.8T parametreleri: BF16’da ~5.6 TB, FP8’de ~2.8 TB, INT4’te ~1.4 TB.
  • 80 GB kartlarda FP8: Minimum olarak ~40 GPU (yaklaşık beş adet 8 GPU’lu düğüm).
  • 141-192 GB hızlandırıcılar, aynı FP8 hedefini yaklaşık 16-24 GPU’ya düşürüyor.
  • KV önbelleği, bağlam x eşzamanlılık ile ölçeklenir; bunu ağırlıkların üzerine bütçeleyin.
Bu rakamlar hızı değil, belleği boyutlandırıyor. Öncelikle gerçek komut istemlerinizle barındırılan bir uç noktada kaliteyi doğrulayın, ardından küme boyutunu başlık parametre sayısına göre değil, ölçtüğünüz bağlam uzunluğuna ve eşzamanlılığa göre belirleyin.

Ollama, vLLM ve SGLang: Hangi Araç?

Kimi K3’ü üretim ölçeğinde çalıştırmak için, vLLM ve SGLang gibi yüksek işlem kapasiteli motorlar doğru araçlardır, çünkü bunlar büyük modelleri birden fazla GPU’da verimli bir şekilde işlemek üzere tasarlanmıştır. Ollama ise tek bir makinede daha küçük modeller için daha uygundur.

Pratik bir yaklaşım, Ollama’yı motor olarak değil, istemci olarak kullanır. Ollama veya OpenAI uyumlu bir istemciyi, vLLM veya SGLang ile sunduğunuz bir Kimi K3 uç noktasına veya barındırılan bir uç noktaya yönlendirebilirsiniz; böylece yerel bir model için kullanacağınız istemci kodunun aynısını kullanmaya devam edersiniz.

Çevrimdışı prototipleme için, iş akışınızı oluşturmak ve test etmek amacıyla Ollama’da çok daha küçük bir açık model çalıştırın, ardından üretim için uç noktayı tam bir Kimi K3 dağıtımına değiştirin. Yerel Ollama’yı 2,8 trilyon parametreli bir modelin çalışma ortamı olarak değil, bir geliştirme ve değerlendirme ortamı olarak ele alın.

  • Üretim ortamına hizmet verme — birden fazla GPU üzerinde vLLM veya SGLang kullanımı.
  • Ollama, istemci olarak veya daha küçük modellerle prototipleme için en uygunudur.
  • OpenAI uyumlu istemciler, yerel ve barındırılan uç noktalar arasında kolayca geçiş yapmanıza olanak tanır.

Gerçekçi Bir Kurulum Taslağı

Kimi K3’ü kendi sunucunuzda barındırmak, her adımı gerçek bir çalışma gerektirse de, tekrarlanabilir bir yol izler. Bunu yazmanın amacı, donanıma geçmeden önce harcanan çabayı görünür kılmaktır.

Önce küçük adımlarla başlayın ve barındırılan bir uç noktada değeri kanıtlayın, ardından yalnızca ihtiyaç duyan iş yükleri için şirket içi çözümlere geçin. Çoğu ekip, trafiğinin yalnızca bir kısmının gerçekten kendi kendine barındırılan modele ihtiyaç duyduğunu fark eder.

Değerlendirme testlerini ilk günden itibaren yapmaya devam edin. Kaliteyi test etmek için kullandığınız gerçek zamanlı komutlar, bir niceleme seviyesinin, sunucu yapılandırmasının veya yeni bir derlemenin gerilediğini de size bildirir.

  • Adım 1 — Öncelikle barındırılan bir Kimi K3 uç noktasında kaliteyi doğrulayın.
  • Adım 2 — Ağırlıkları Moonshot’un resmi Hugging Face veya GitHub sürümünden indirin.
  • 3. Adım — Donanımınız ve kalite çubuğunuz için hassasiyet ve niceleme seçeneklerini belirleyin.
  • 4. Adım — Çoklu GPU kümesi üzerinde vLLM veya SGLang ile sunum yapın.
  • Adım 5 — Uygulama kodunun değişmeden kalması için önüne OpenAI uyumlu bir ağ geçidi yerleştirin.
  • Adım 6 — Değerlendirme testinizi çalıştırın ve maliyeti, gecikmeyi ve kaliteyi izleyin.
Değiştirilmiş veya yanlış etiketlenmiş dosyaları önlemek için ağırlık dosyalarını her zaman Moonshot’un resmi depolarından indirin, üçüncü taraf aynalardan değil.

Kendi sunucunuzda barındırmak mı yoksa API kullanmak mı daha iyi?

Veri yerleşimi veya katı bir uyumluluk kuralı gerektirdiğinde ve bunu çalıştırmak için altyapınız ve makine öğrenimi mühendisliğiniz varsa Kimi K3’ü kendi sunucunuzda barındırın. Donanım yükünü taşımaya değer olduğu durum budur.

Hız, düşük başlangıç ​​maliyeti ve donanıma ihtiyaç duymadığınızda ve verileriniz Çin’de barındırılan bir uç noktanın sorun teşkil edeceği kadar hassas olmadığında, barındırılan API’yi kullanın. Çoğu ekip ve çoğu iş yükü için bu daha iyi bir varsayılan seçenektir.

Hibrit çözüm genellikle en iyisidir. Düzenlemeye tabi veya hassas trafiği kendi sunucunuzda barındırdığınız bir dağıtıma, geri kalan her şeyi ise barındırılan API’ye yönlendirin; böylece kendi sunucunuzda barındırmanın getirdiği ek maliyeti yalnızca gerçekten uyumluluk sağladığı durumlarda ödersiniz.

  • Kendi sunucunuzda barındırma — veri yerleşimi, uyumluluk ve şirket içi makine öğrenimi becerileri.
  • Barındırılan API — hız, düşük maliyet, donanım gerektirmez, hassas olmayan veriler.
  • Hibrit — yalnızca düzenlenmiş trafiği kendi sunucunuzda barındırın; geri kalanı için API kullanın.

Kimi K3’ü kendiniz çalıştırmak için ihtiyacınız olanlar

Kimi K3, öncü ölçekte bir Uzmanlar Karışımı modeli olduğundan, “kendiniz çalıştırmak” gerçek bir altyapı kararıdır; tek bir dizüstü bilgisayar veya oyun GPU’su ile yapılabilecek bir şey değildir. Aşağıdaki yolu, kendi sunucunuzda barındırma ihtiyacınızın ciddiyetine göre eşleştirin. Çoğu ekip için API veya kiralık GPU’lar doğru cevaptır; donanım satın almak yalnızca istikrarlı, yüksek hacimli işlemlerde veya verilerinizin asla kendi duvarlarınızdan dışarı çıkamayacağı durumlarda karşılığını verir.

Yol Bu nedir? En iyisi Başlayın
Barındırılan API’yi çağırın Kimi K3’ü donanım gerektirmeyen, token başına ödeme yapılan bir API olarak kullanın. Çoğu takım; karar vermeden önce değerlendirme yapar. OpenRouter
GPU’ları saatlik olarak kiralayın. İhtiyaç duyulduğunda H100 / A100 düğümlerini devreye alın, işlem tamamlandıktan sonra devre dışı bırakın. Sermaye yatırımı gerektirmeyen kendi sunucunuzda barındırma; ani iş yükleri RunPod
Birleşik bellekte yerel 4 bitlik bir niceleme işlemini tutmaya yetecek kadar birleşik belleğe sahip tek bir iş istasyonu. Tek bir güçlü yerel sunucu; gizliliğe öncelik veren bireysel/KOBİ kullanımı. Apple Mac Studio (M3 Ultra, 512GB)
İş istasyonu GPU’larında yerel MoE yükünü hafifletmek / tensör paralelliği için birden fazla 48 GB profesyonel kart. Güçlü kullanıcılar ve kendi kartlarına sahip olmak isteyen küçük gruplar. NVIDIA RTX 6000 Ada (48GB)

Kimi K3 çalışmaya başladıktan sonra, onu günlük olarak kullanmanın en hızlı yolu Cursor içinde , OpenRouter üzerinden özel bir model olarak modele yönlendirmektir.