Amazon araştırmacıları tarafından geliştirilen AgentSysBench benchmark’ı, üretim ortamındaki AI ajanlarının performans maliyetlerini gözler önüne serdi. Çalışma, ajan tabanlı uygulamaların neden beklenenden karmaşık ve pahalı çalıştığını açıklıyor.
Sandbox Belleği 28 GB’a Kadar Çıkıyor
Araştırmaya göre, sandbox çalışma alanları oturum başına 28 GB’a kadar bellek tüketebiliyor. On adet enstrümente edilmiş ajanik uygulama incelendiğinde, beşinde gecikme (latency) LLM dışı bileşenler tarafından domine ediliyor.
Görev Gecikmeleri 32 Kat Fark Edebilir
Bir uygulama içindeki görev gecikmeleri, 32 kata kadar farklılık gösterebiliyor. Bu varyasyon, GPU-bounded inference, memory-bounded retrieval ve CPU-bounded sandbox’lar arasındaki farktan kaynaklanıyor. Üretim oturumları, aktif adımlar arasında dakikalarca veya saatlerce boş durumda bekleyebiliyor.
Kontrol Düzlemi Vergisi: Üretken Hesaplamayı Gizli Tüketen Masraf
Auxiliary LLM çağrıları ve araç şema overhead’i, üretken hesaplamayı “kontrol düzlemi vergisi” adı altında gizliyor. Bu masraf, toplam maliyetin önemli bir kısmını oluşturuyor.
Üretim AI Ajanları İçin 3 Optimizasyon Stratejisi
Araştırma, üç somut çözüm öneriyor: görev-bilinçli sunum (task-aware serving) gecikmeyi %29-40 düşürüyor, durum offloading bellek tüketimini 4.6 kat azaltıyor ve araç-sonuç önbellekleme gereksiz arama çağrılarının %35.2’sini ortadan kaldırıyor.
AgentSysBench: Yeni Bir Benchmark Standardı
Amazon ve meslektaşları tarafından geliştirilen AgentSysBench, ajanik iş yüklerini karakterize etmek için altı temel özellik tanımlıyor. Bu benchmark, gelecekte üretim AI sistemlerinin değerlendirilmesinde standart bir referans noktası olabilir. Bu bulgular, üretim ortamında AI ajanı dağıtan ekiplerin yalnızca model performansına değil, tüm sistem mimarisine odaklanması gerektiğini gösteriyor.
Kaynak: @dair_ai (X/Twitter), ArXiv Paper
Henüz yorum yok. İlk yorumu siz yapın!