vLLM ekibi, tek bir vllm serve sürecinin prefill, decode ve CPU işlerini bir arada yapmasının yüksek eşzamanlılıkta akışları nasıl kilitlediğini anlatan disaggregated serving pratik rehberini yayınladı.
Ne ayrılıyor?
- Prefill: tüm istemi bir geçişte işler, TTFT’yi belirler, hesaplama sınırlı
- Decode: token token üretir, bellek bant genişliği / ITL odaklı
- CPU frontend: tokenization, şablon, araç/akıl yürütme ayrıştırma — GPU düğümünden çıkarılıp
/renderve/derenderile token ID üzerinden motor beslenir
Prefill ile decode ayrıldığında uzun istemlerin diğer yanıtları durdurmaması için KV önbelleğinin hızlı taşınması gerektiği vurgulanıyor. Rehber vLLM v0.30.0+ ile uçtan uca kurulum, ne zaman ayrıştırmanın değeceği ve hâlâ açık boşlukları kapsıyor.
Henüz yorum yok. İlk yorumu siz yapın!