CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
3 Oct 2026 · 23:20 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
TEKNOLOJI SAYI #2.765 3 Eki 2026 · Cumartesi

Baseten deneyi: LLM’in yazdığı çıkarım motoru vLLM’den yüzde 90’a kadar hızlı

Baseten mühendisleri, bir LLM’in sıfırdan yazdığı çıkarım motorunu kendi deneylerinde vLLM ile karşılaştırdı.

AiHaber Editör
Editör
2DK 2OKUMA

★ Hızlı Özet

  • Baseten mühendisleri, bir LLM’in sıfırdan yazdığı çıkarım motorunu kendi deneylerinde vLLM ile karşılaştırdı.
  • Ne denendi MetaInfer, yazarlarının “yalnızca beceri” dediği bir çerçeve: model sonradan eğitilmiyor, özel bir koşum yok. Baseten yazısı, idd…
  • Bu bağımsız bir liderlik tablosu değil Rakamlar Baseten’in kendi deneyinin sonucu. Üçüncü tarafın aynı koşullarda tekrarladığı bir ölçüm bu …

Baseten mühendisleri, bir LLM’in sıfırdan yazdığı çıkarım motorunu kendi deneylerinde vLLM ile karşılaştırdı. Yazıya göre Claude Code ve Fable 5, MetaInfer beceri setiyle Qwen-3.6-35B-A3B için NVFP4 hassasiyetinde bir motor üretti. Tek B200 üzerinde bu motor, deney anındaki son sürüm olan vLLM 0.25.1’e göre tek akış kod çözüm hızında yüzde 90’a kadar, ilk belirteç süresinde (TTFT) 2,33 kat hızlı ölçüldü. Başlık aralığı yüzde 50–90 ve yaklaşık 2,3 kat TTFT diyor; gövde tek akış için “yüzde 90’a kadar” ve 2,33 katı veriyor.

Ne denendi

MetaInfer, yazarlarının “yalnızca beceri” dediği bir çerçeve: model sonradan eğitilmiyor, özel bir koşum yok. Baseten yazısı, iddiaya şüpheyle bakıp depoyu popüler bir modelde denediklerini anlatıyor. Çıkarım performansını bu tür otomatik iyileştirme için uygun görüyorlar; çünkü TTFT, belirteç başına süre, çip başına verim ve bellek ölçülebilir, doğruluk da tam hassasiyetli referansa karşı sayısal kontrol edilebiliyor.

Bu bağımsız bir liderlik tablosu değil

Rakamlar Baseten’in kendi deneyinin sonucu. Üçüncü tarafın aynı koşullarda tekrarladığı bir ölçüm bu yazıda yok. İkinci deney, SAM 3.1 ile görüntü bölütleme; bu haber o deneyin ayrı bir hız katsayısını şirket yazısının özet cümlesinden almıyor.

Kaynak: Baseten — Agentic inference optimization

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları