DAIR.AI araştırma ekibi, yapay zeka ajan maliyet optimizasyonu konusunda kritik bulguları paylaştı. On instrumentlı yapay zeka ajanı uygulaması üzerinde yapılan araştırmaya göre, LLM dışı bileşenler beş uygulamada gecikmenin büyük çoğunluğunu oluşturuyor.
Üretim Ortamında Gerçek Maliyet Yapısı
Üretim ortamlarındaki ajanlar sandık başına 28 GB’a varan çalışma seti kullanımıyla çalışıyor. Üretim oturumları, aktif adımlar arasında dakikalarca hatta saatlerce boş durumda bekleyebiliyor.
32 Kata Kadar Performans Farkı
Bir uygulama içinde görev gecikmeleri, ortam türüne bağlı olarak 32 kata kadar farklılık gösterebiliyor. GPU bağımlı çıkarım, bellek bağımlı geri alma ve CPU bağımlı sandık ortamları arasında büyük performans farkları var.
Maliyet Düşürme Yöntemleri
Görev bilincli sunum gecikmeyi yüzde 29 ile 40 arasında düşürüyor. Durum boşaltma bellek kullanımını 4,6 kat azaltıyor. Araç sonucu önbellekleme gereksiz arama çağrılarının yüzde 35,2’sini ortadan kaldırıyor.
Detaylı araştırma için orijinal araştırma makalesini inceleyebilirsiniz.
Henüz yorum yok. İlk yorumu siz yapın!