Mevcut Hafıza Testleri Yeterli Değil
Yapay zeka araştırmalarında uzun vadeli hafıza konusu giderek kritik bir önem kazanıyor. UCLA araştırmacıları, mevcut hafıza kıyaslamalarının çoğunlukla kullanıcı geçmişini test ettiğini, ancak üretim ortamlarındaki yapay zeka araçlarının asıl ihtiyacının bu olmadığını ortaya koydu.
Gerçek üretim ortamlarında yapay zeka araçlarının, deneyimli bir meslektaş gibi çalışma ortamını içselleştirmesi gerekiyor. Bu, arayüz özelliklerini, durum dinamiklerini, iş akışı bilgilerini ve tekrarlayan hata modlarını hatırlamayı içeriyor.
LongMemEval-V2: Yeni Kriter
UCLA araştırma ekibi bu sorunu çözmek için LongMemEval-V2 (LME-V2) adlı yeni bir kıyaslamayı tanıttı. Bu kıyaslama, yapay zeka araçlarının özelleştirilmiş web ortamlarında uzman düzeyinde performans göstermesini test ediyor.
LME-V2, beş temel hafıza yeteneğini kapsayan 451 adet manuel olarak derlenmiş soru içeriyor: statik durum hatırlama, dinamik durum takibi, iş akışı bilgisi, ortam tuzakları ve önkoşul farkındalığı. Sorular, her soru başına 500 iz ve 115 milyon token’a kadar ölçeklenen geçmiş izlerle eşleştirildi.
AgentRunbook-C: Yüzde 72.5 Doğruluk
Araştırmacılar iki hafıza yöntemi öneriyor. AgentRunbook-R, ham durum gözlemleri, olaylar ve strateji notları için bilgi havuzları kullanan verimli RAG tabanlı bir hafıza sistemi. AgentRunbook-C ise izleri dosya olarak depolayan ve bir kodlama aracısını sanal alanda kanıt toplamak için çağıran yöntem.
Deneylerin en çarpıcı sonucu, AgentRunbook-C’nin yüzde 72.5 ortalama doğruluk oranına ulaşması. Bu, en güçlü RAG tabanlı temel yöntemin (yüzde 48.5) ve hazır kodlama aracısının (yüzde 69.3) oldukça üzerinde bir performans.
Neden Önemli?
Bu bulgular, yapay zeka hafızasını kullanıcı geçmişi yerine ortam uzmanlığı olarak yeniden çerçevelendiriyor. Özellikle özel web ortamlarında çalışan yapay zeka araçları için, izler üzerinde RAG kullanmak ciddi performans kaybına neden oluyor ve AgentRunbook-C ile yüzde 24 puanlık bir iyileşme fırsatı kaçırılmış oluyor.
Araştırma arxiv.org üzerinde yayımlandı.
Kaynak: @dair_ai / X (Twitter)
Henüz yorum yok. İlk yorumu siz yapın!