CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
5 Sep 2026 · 18:13 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
HAFTANıN TRENDLERI SAYI #2.581 27 Ağu 2026 · Perşembe

LongMemEval-V2: Yapay Zeka Aracılarının Uzun Vadeli Hafıza Sorunu Çözüme Kavuşuyor

Mevcut Hafıza Testleri Yeterli Değil Yapay zeka araştırmalarında uzun vadeli hafıza konusu giderek kritik bir önem kazanıyor. UCLA araştırmacıları, mevcut hafıza kıyaslamalarının çoğunlukla kullanıcı…

AiHaber Editör
Editör
2DK 16OKUMA

★ Hızlı Özet

  • Yapay zeka araştırmalarında uzun vadeli hafıza konusu giderek kritik bir önem kazanıyor.
  • Gerçek üretim ortamlarında yapay zeka araçlarının, deneyimli bir meslektaş gibi çalışma ortamını içselleştirmesi gerekiyor.
  • LME-V2, beş temel hafıza yeteneğini kapsayan 451 adet manuel olarak derlenmiş soru içeriyor: statik durum hatırlama, dinamik durum takibi, i…
  • Deneylerin en çarpıcı sonucu, AgentRunbook-C'nin yüzde 72.5 ortalama doğruluk oranına ulaşması.

Mevcut Hafıza Testleri Yeterli Değil

Yapay zeka araştırmalarında uzun vadeli hafıza konusu giderek kritik bir önem kazanıyor. UCLA araştırmacıları, mevcut hafıza kıyaslamalarının çoğunlukla kullanıcı geçmişini test ettiğini, ancak üretim ortamlarındaki yapay zeka araçlarının asıl ihtiyacının bu olmadığını ortaya koydu.

Gerçek üretim ortamlarında yapay zeka araçlarının, deneyimli bir meslektaş gibi çalışma ortamını içselleştirmesi gerekiyor. Bu, arayüz özelliklerini, durum dinamiklerini, iş akışı bilgilerini ve tekrarlayan hata modlarını hatırlamayı içeriyor.

LongMemEval-V2: Yeni Kriter

UCLA araştırma ekibi bu sorunu çözmek için LongMemEval-V2 (LME-V2) adlı yeni bir kıyaslamayı tanıttı. Bu kıyaslama, yapay zeka araçlarının özelleştirilmiş web ortamlarında uzman düzeyinde performans göstermesini test ediyor.

LME-V2, beş temel hafıza yeteneğini kapsayan 451 adet manuel olarak derlenmiş soru içeriyor: statik durum hatırlama, dinamik durum takibi, iş akışı bilgisi, ortam tuzakları ve önkoşul farkındalığı. Sorular, her soru başına 500 iz ve 115 milyon token’a kadar ölçeklenen geçmiş izlerle eşleştirildi.

AgentRunbook-C: Yüzde 72.5 Doğruluk

Araştırmacılar iki hafıza yöntemi öneriyor. AgentRunbook-R, ham durum gözlemleri, olaylar ve strateji notları için bilgi havuzları kullanan verimli RAG tabanlı bir hafıza sistemi. AgentRunbook-C ise izleri dosya olarak depolayan ve bir kodlama aracısını sanal alanda kanıt toplamak için çağıran yöntem.

Deneylerin en çarpıcı sonucu, AgentRunbook-C’nin yüzde 72.5 ortalama doğruluk oranına ulaşması. Bu, en güçlü RAG tabanlı temel yöntemin (yüzde 48.5) ve hazır kodlama aracısının (yüzde 69.3) oldukça üzerinde bir performans.

Neden Önemli?

Bu bulgular, yapay zeka hafızasını kullanıcı geçmişi yerine ortam uzmanlığı olarak yeniden çerçevelendiriyor. Özellikle özel web ortamlarında çalışan yapay zeka araçları için, izler üzerinde RAG kullanmak ciddi performans kaybına neden oluyor ve AgentRunbook-C ile yüzde 24 puanlık bir iyileşme fırsatı kaçırılmış oluyor.

Araştırma arxiv.org üzerinde yayımlandı.

Kaynak: @dair_ai / X (Twitter)

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları