CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
27 Aug 2026 · 01:48 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
AI SAYI #2.220 27 Ağu 2026 · Perşembe

LongMemEval-V2: Yapay Zeka Ajanları İçin Yeni Bellek Benchmark’ı Yayınlandı

Yapay zeka ajanlarının uzun süreli bellek sistemleri, özelleştirilmiş web ortamlarında başarılı olabilmek için kritik öneme sahip.

AiHaber Editör
Editör
3DK 2OKUMA

★ Hızlı Özet

  • Yapay zeka ajanlarının uzun süreli bellek sistemleri, özelleştirilmiş web ortamlarında başarılı olabilmek için kritik öneme sahip.
  • Mevcut Bellek Benchmark'larının Sınırlılıkları Günümüzde kullanılan ajan bellek benchmark'larının çoğu kullanıcı geçmişlerini, kısa izleri v…
  • LongMemEval-V2: Kapsamlı Bellek Değerlendirme Çerçevesi LongMemEval-V2 (LME-V2), bellek sistemlerinin ajanların özelleştirilmiş ortamlarda d…
  • Statik Durum Hatırlama: Arayüz öğeleri ve kalıcı bilgiyi geri çağırma Dinamik Durum Takibi: Sürekli değişen sistem durumlarını izleme İş Akı…

Yapay zeka ajanlarının uzun süreli bellek sistemleri, özelleştirilmiş web ortamlarında başarılı olabilmek için kritik öneme sahip. UCLA araştırmacıları tarafından geliştirilen LongMemEval-V2 benchmark’ı, bu alanda çığır açan bir değerlendirme çerçevesi sunuyor.

Mevcut Bellek Benchmark’larının Sınırlılıkları

Günümüzde kullanılan ajan bellek benchmark’larının çoğu kullanıcı geçmişlerini, kısa izleri veya downstream görev başarısını test ediyor. Ancak bu yaklaşım, ajanların gerçek üretim ortamlarında ihtiyaç duyduğu çevresel uzmanlığı doğrudan değerlendirmiyor. Başarı; arayüz özelliklerini hatırlamak, durum dinamiklerini takip etmek, iş akışı bilgisini özümsemek ve tekrarlayan hata modlarını öğrenmekle doğrudan ilişkili.

LongMemEval-V2: Kapsamlı Bellek Değerlendirme Çerçevesi

LongMemEval-V2 (LME-V2), bellek sistemlerinin ajanların özelleştirilmiş ortamlarda deneyimli bir meslektaş gibi uzmanlaşmasını sağlayıp sağlayamadığını değerlendirmek üzere tasarlandı. Benchmark, beş temel bellek yeteneğini kapsayan 451 manuel olarak seçilmiş soru içeriyor:

  • Statik Durum Hatırlama: Arayüz öğeleri ve kalıcı bilgiyi geri çağırma
  • Dinamik Durum Takibi: Sürekli değişen sistem durumlarını izleme
  • İş Akışı Bilgisi: Prosedürleri ve en iyi uygulamaları öğrenme
  • Çevresel Tuzaklar: Tekrarlayan hata modlarını tanıma
  • Ön Koşul Farkındalığı: Görev önkoşullarını anlama

Sorular, soru başına 500 yörünge ve 115M token’a kadar ölçeklenen geçmiş yörüngeleriyle eşleştirildi.

AgentRunbook-C Yöntemi: %72,5 Doğruluk

Araştırmacılar iki bellek yöntemi öneriyor:

AgentRunbook-R, ham durum gözlemleri, olaylar ve strateji notları için bilgi havuzları kullanan verimli bir RAG tabanlı bellek sistemidir. AgentRunbook-C ise yörüngeleri dosya olarak saklar ve bir kodlama ajanını çağırarak artırılmış bir sandbox ortamında kanıt toplar.

Deneyler, AgentRunbook-C’nin en iyi performansı elde ettiğini ortaya koyuyor: %72,5 ortalama doğruluk. Bu sonuç, en güçlü RAG baseline’ının (%48,5) ve hazır kodlama ajanı baseline’ının (%69,3) oldukça önünde.

Performans-Gecikme Dengesi

Güçlü performans kazanımlarına rağmen, kodlama ajanı tabanlı yöntemlerin yüksek gecikme maliyetleri bulunuyor. AgentRunbook-C, doğruluk-gecikme Pareto sınırını ileriye taşıyor olsa da, önemli iyileştirme alanı bulunuyor.

Yapay Zeka Ajan Bellek Sistemleri İçin Yeni Perspektif

Bu araştırma, ajan belleğini kullanıcı geçmişi yerine çevresel uzmanlık olarak yeniden çerçeveliyor. Özel bir web ortamında çalışan ajanlar için yörünge RAG’ı, masada bırakılan 24 puan anlamına geliyor.

Kaynak: arXiv:2605.12493 — DAIR.AI (@dair_ai)

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları