CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
29 Aug 2026 · 01:10 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #2.366 29 Ağu 2026 · Cumartesi

Yapay Zeka Uzun Vadeli Gorevlerde Kritik Sinira Carpti: Long-Horizon-Terminal-Bench Sonuclari Sok Etti

Yapay zeka uzun vadeli gorevler alaninda yapilan yeni bir arastirma, en guclu yapay zeka sistemlerinin bile yuzlerce adimli gorevlerde ciddi sekilde basarisiz oldugunu ortaya koydu.

AiHaber Editör
Editör
2DK

★ Hızlı Özet

  • Yapay zeka uzun vadeli gorevler alaninda yapilan yeni bir arastirma, en guclu yapay zeka sistemlerinin bile yuzlerce adimli gorevlerde ciddi sekilde basarisiz oldugunu ortaya koydu.
  • Uzun Vadeli Yapay Zeka Gorevlerinde Kriz: Ortalama Basari Orani Yuzde 6,4
  • Long-Horizon-Terminal-Bench, yapay zeka ajanlarinin yuzlerce adim gerektiren terminal gorevlerinde ne kadar iyi performans gosterdigini olcmek icin tasarlandi.
  • Basarisiz olan calistirmalarin yuzde 79 unda model, halihazirda calismaya devam ederken saatin dolmasi nedeniyle sona erdi.

Yapay zeka uzun vadeli gorevler alaninda yapilan yeni bir arastirma, en guclu yapay zeka sistemlerinin bile yuzlerce adimli gorevlerde ciddi sekilde basarisiz oldugunu ortaya koydu. Tencent Hunyuan tarafindan yayinlanan Long-Horizon-Terminal-Bench arastirmasi, 17 frontier modelin 46 uzun vadeli gorev uzerindeki performansini degerlendirdi.

Uzun Vadeli Yapay Zeka Gorevlerinde Kriz: Ortalama Basari Orani Yuzde 6,4

Long-Horizon-Terminal-Bench, yapay zeka ajanlarinin yuzlerce adim gerektiren terminal gorevlerinde ne kadar iyi performans gosterdigini olcmek icin tasarlandi. Sonuclar sok edici: 17 frontier model arasinda ortalama basari orani yalnizca yuzde 6,4. Siki tamamlama degerlendirmesi altinda ise 17 modelden 10 u sifir gorev cozmdu.

Basarisiz olan calistirmalarin yuzde 79 unda model, halihazirda calismaya devam ederken saatin dolmasi nedeniyle sona erdi. En iyi performans gosteren model bile yuzde 28,3 basari oraniyla her 10 gorevden 7 sin tamamlayamadan birakti.

Modeller Yerel Olarak Akilli Ancak Sonuc Uretemiyor

Arastirmacilar, modellerin yerel olarak makul adimlar gerceklestirebildigini ancak yuzlerce adimi guvenilir bir sekilde tamamlanmis bir sonuca donusturemedigini vurguladi. Bu bulgu, yapay zeka uzun vadeli gorevler konusundaki temel sorunu goyler onune seriyor: kisa sureli gorevlerde etkileyici performans sergileyen modeller, uzun soluklu islerde kritik bir dusus yasiyor.

Long-Horizon-Terminal-Bench projesi sayfasi: https://zli12321.github.io/LHTB/

Yapay Zeka Uzun Vadeli Gorevler Icin Ne Anlama Geliyor?

Bu bulgular, mevcut yapay zeka sistemlerinin gercek dunya uzun vadeli gorevlerinde guvenilir bir sekilde calisabilmesi icin onemli iyilestirmelere ihtiyac duyuldugunu ortaya koyuyor. Arastirma, yapay zeka uzun vadeli gorevler performans arastirmasi alaninda onemli bir kilometre tasi niteliginde.

Uzmanlar, ajan yonetimi ve egitim ortamlarinin gelistirilmesinin bu sorunu cozmek icin kritik oneme sahip oldugunu belirtiyor. AgentMercury arastirmasi, yapay zeka ajanlarinin egitim ortamlarinda nasil iyilestirilebilecegine dair onemli veriler sunuyor.

Yapay zeka uzun vadeli gorevler konusunda ilerleme kaydedilmesi, ozelikle kod uretimi, bilimsel arastirma ve karmasik muhendislik projeleri gibi alanlarda kritik onem tasiyor. Arastirma, 14 Temmuz 2026 tarihinde yayinlandi ve Tencent Hunyuan Frontier ekibi ile ABD deki universitelerin ortak calismasi.

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları