Prime Intellect, sınır açık modelleri sunmak için Prime Inference platformunu duyurdu. Platform hem sunucusuz uçlar hem ayrılmış kapasite kapsıyor; modeller birden fazla veri merkezindeki GPU altyapısında çalışıyor. Şirket, sürekli öğrenme döngüsünün model gerçek kullanıcıya sunulup izler eğitime dönmeden kapanmadığını yazıyor.
İçeride ne taşıyordu
Prime Inference önce kendi sunum katmanı olarak kullanılmış. Herkese açılmadan önce büyük ölçekli RL açılımları, sentetik veri, değerlendirme ve uzun kod ajanlarını çalıştırmış; şirket yalnızca iç iş yükünde günde yaklaşık bir trilyon belirteç işlendiğini söylüyor. Müşteri kurulumları Ocak’tan beri üretimdeymiş.
GLM-5.3 ve yığın
İlk herkese açık uç GLM-5.3, 22 Eylül’de OpenRouter’da açılmış. Prime, ucun OpenRouter’daki en hızlı GLM-5.3 uçları arasında yer aldığını, araç çağrısı hata oranının neredeyse sıfır ve lansmandan beri çalışma süresinin yüzde 100 olduğunu belirtiyor. Bunlar şirketin kendi ölçümü. Modeller bugün NVIDIA Blackwell üzerinde; Vera Rubin’in geleceği söyleniyor. Yığın NVIDIA Dynamo, vLLM, Mooncake ve FlashInfer; Inferact ve NVIDIA ile birlikte, iyileştirmeler yukarı akışa gidiyor. GLM-5.3 üretimi GB200 NVL72 üzerinde anlatılıyor. Tipik bir ajan turu, yazıya göre 140 bin belirteçlik bir isteme yaklaşık 6 bin belirteç ekliyor.
Henüz yorum yok. İlk yorumu siz yapın!