Yapay zeka ajanlarının uzun süreli bellek sistemleri, özelleştirilmiş web ortamlarında başarılı olabilmek için kritik öneme sahip. UCLA araştırmacıları tarafından geliştirilen LongMemEval-V2 benchmark’ı, bu alanda çığır açan bir değerlendirme çerçevesi sunuyor.
Mevcut Bellek Benchmark’larının Sınırlılıkları
Günümüzde kullanılan ajan bellek benchmark’larının çoğu kullanıcı geçmişlerini, kısa izleri veya downstream görev başarısını test ediyor. Ancak bu yaklaşım, ajanların gerçek üretim ortamlarında ihtiyaç duyduğu çevresel uzmanlığı doğrudan değerlendirmiyor. Başarı; arayüz özelliklerini hatırlamak, durum dinamiklerini takip etmek, iş akışı bilgisini özümsemek ve tekrarlayan hata modlarını öğrenmekle doğrudan ilişkili.
LongMemEval-V2: Kapsamlı Bellek Değerlendirme Çerçevesi
LongMemEval-V2 (LME-V2), bellek sistemlerinin ajanların özelleştirilmiş ortamlarda deneyimli bir meslektaş gibi uzmanlaşmasını sağlayıp sağlayamadığını değerlendirmek üzere tasarlandı. Benchmark, beş temel bellek yeteneğini kapsayan 451 manuel olarak seçilmiş soru içeriyor:
- Statik Durum Hatırlama: Arayüz öğeleri ve kalıcı bilgiyi geri çağırma
- Dinamik Durum Takibi: Sürekli değişen sistem durumlarını izleme
- İş Akışı Bilgisi: Prosedürleri ve en iyi uygulamaları öğrenme
- Çevresel Tuzaklar: Tekrarlayan hata modlarını tanıma
- Ön Koşul Farkındalığı: Görev önkoşullarını anlama
Sorular, soru başına 500 yörünge ve 115M token’a kadar ölçeklenen geçmiş yörüngeleriyle eşleştirildi.
AgentRunbook-C Yöntemi: %72,5 Doğruluk
Araştırmacılar iki bellek yöntemi öneriyor:
AgentRunbook-R, ham durum gözlemleri, olaylar ve strateji notları için bilgi havuzları kullanan verimli bir RAG tabanlı bellek sistemidir. AgentRunbook-C ise yörüngeleri dosya olarak saklar ve bir kodlama ajanını çağırarak artırılmış bir sandbox ortamında kanıt toplar.
Deneyler, AgentRunbook-C’nin en iyi performansı elde ettiğini ortaya koyuyor: %72,5 ortalama doğruluk. Bu sonuç, en güçlü RAG baseline’ının (%48,5) ve hazır kodlama ajanı baseline’ının (%69,3) oldukça önünde.
Performans-Gecikme Dengesi
Güçlü performans kazanımlarına rağmen, kodlama ajanı tabanlı yöntemlerin yüksek gecikme maliyetleri bulunuyor. AgentRunbook-C, doğruluk-gecikme Pareto sınırını ileriye taşıyor olsa da, önemli iyileştirme alanı bulunuyor.
Yapay Zeka Ajan Bellek Sistemleri İçin Yeni Perspektif
Bu araştırma, ajan belleğini kullanıcı geçmişi yerine çevresel uzmanlık olarak yeniden çerçeveliyor. Özel bir web ortamında çalışan ajanlar için yörünge RAG’ı, masada bırakılan 24 puan anlamına geliyor.
Kaynak: arXiv:2605.12493 — DAIR.AI (@dair_ai)
Henüz yorum yok. İlk yorumu siz yapın!