Baseten mühendisleri, bir LLM’in sıfırdan yazdığı çıkarım motorunu kendi deneylerinde vLLM ile karşılaştırdı. Yazıya göre Claude Code ve Fable 5, MetaInfer beceri setiyle Qwen-3.6-35B-A3B için NVFP4 hassasiyetinde bir motor üretti. Tek B200 üzerinde bu motor, deney anındaki son sürüm olan vLLM 0.25.1’e göre tek akış kod çözüm hızında yüzde 90’a kadar, ilk belirteç süresinde (TTFT) 2,33 kat hızlı ölçüldü. Başlık aralığı yüzde 50–90 ve yaklaşık 2,3 kat TTFT diyor; gövde tek akış için “yüzde 90’a kadar” ve 2,33 katı veriyor.
Ne denendi
MetaInfer, yazarlarının “yalnızca beceri” dediği bir çerçeve: model sonradan eğitilmiyor, özel bir koşum yok. Baseten yazısı, iddiaya şüpheyle bakıp depoyu popüler bir modelde denediklerini anlatıyor. Çıkarım performansını bu tür otomatik iyileştirme için uygun görüyorlar; çünkü TTFT, belirteç başına süre, çip başına verim ve bellek ölçülebilir, doğruluk da tam hassasiyetli referansa karşı sayısal kontrol edilebiliyor.
Bu bağımsız bir liderlik tablosu değil
Rakamlar Baseten’in kendi deneyinin sonucu. Üçüncü tarafın aynı koşullarda tekrarladığı bir ölçüm bu yazıda yok. İkinci deney, SAM 3.1 ile görüntü bölütleme; bu haber o deneyin ayrı bir hız katsayısını şirket yazısının özet cümlesinden almıyor.
Henüz yorum yok. İlk yorumu siz yapın!