CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
23 Sep 2026 · 01:57 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.655 24 Ağu 2026 · Pazartesi

Meta EvoHarness-RL: AI Ajanslarında %96.9 Başarı Oranı

Uzun süreli AI ajanlarının en büyük sorunlarından biri, dış araç ve bellek kaynaklarını ne zaman kullanacaklarını bilememektir.

AiHaber Editör
Editör
2DK 4OKUMA

★ Hızlı Özet

  • Uzun süreli AI ajanlarının en büyük sorunlarından biri, dış araç ve bellek kaynaklarını ne zaman kullanacaklarını bilememektir.
  • EvoHarness-RL, Qwen3-8B modeli ile ALFWorld benchmark testinde %96.9 başarı oranına ulaştı.
  • EvoHarness-RL üç temel dış durum türünü ajanın kullanımına sunuyor.
  • İki kritik dinamik eğitim sürecinde ortaya çıkıyor.

Uzun süreli AI ajanlarının en büyük sorunlarından biri, dış araç ve bellek kaynaklarını ne zaman kullanacaklarını bilememektir. Meta araştırmacıları bu sorunu EvoHarness-RL ile çözmeyi başardı. Yeni RL tabanlı yöntem, ajanların dış durum erişim stratejisini öğrenmesini sağlıyor.

ALFWorld Testinde %96.9 Başarı

EvoHarness-RL, Qwen3-8B modeli ile ALFWorld benchmark testinde %96.9 başarı oranına ulaştı. ReAct yönteminde bu oran yalnızca %47.9 seviyesindeydi. Görülmemiş görevlerde ise EvoHarness-RL, ReAct’ın %50 başarısına kıyasla %86.6 oranına ulaştı. RL eğitimi sırasında harness çağrıları bölüm başına yaklaşık 1’e düştü.

Üç Temel Dış Durum Türü

EvoHarness-RL üç temel dış durum türünü ajanın kullanımına sunuyor. Bunlar; mevcut durumu temsil eden Belief, tamamlanan adımları izleyen Progress ve geçmiş deneyimleri depolayan Experience olarak sınıflandırılıyor. Denetimli ince ayar aşamasında ajan, harness eylem alanını ve yararlı dış durumun nasıl oluşturulacağını öğreniyor. Ardından GRPO algoritması, uzun süreli etkileşim boyunca durumu okuma, güncelleme ve konsolide etme stratejilerini keşfediyor.

Harness Annealing ve Harness Evolution

İki kritik dinamik eğitim sürecinde ortaya çıkıyor. Harness annealing olarak adlandırılan ilk dinamikte, tekrarlanan harness kullanım kalıpları model politikasına internalize ediliyor ve ajan sık harness çağrılarından seçici dış durum erişimine yöneliyor. Harness evolution olarak adlandırılan ikinci dinamikte ise ilerleme güncellemeleri ve deneyim konsolidasyonu, harness’ı kompakt ve göreve uyarlanabilir bir durum alt tabanına dönüştürüyor.

Ajan Geliştiriciler İçin Çıkarımlar

Araştırmacılar, ajan geliştiricilerin constant bellek erişimini sabit kodlamak yerine, politikayı belleği ne zaman sorgulayacağını öğrenmesi için eğitmesi gerektiğini vurguluyor. Çalışma, daha güçlü araçlar veya daha büyük bellekler eklemek yerine, dış harness çalışma alanlarıyla birlikte çalışmak için eğitilebilir politikaların uzun süreli ajanlar için kritik olduğunu ortaya koyuyor.

Kaynak

Araştırma, detaylı inceleme için arxiv.org/abs/2608.05446 adresinde yayınlandı.

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları