Ne olduğu sorulduğunda, cevap şu: Yeni bir araştırma, yapay zeka ajanlarının uzun vadeli görevlerde insanların yalnızca yüzde 27,3’ü kadar para kazanabildiğini ortaya koydu. Nasıl test edildiği incelendiğinde ise araştırmacıların sekiz önde gelen modeli bir yıllık bir simülasyon ortamında karşı karşıya getirdiği görülüyor. Neden bu sonuç önemli? Çünkü yapay zeka uzun vadeli görev açısından insan performansının çok gerisinde kalıyor. Kim bu araştırmayı yaptı? Stanford AI Club bünyesinde gerçekleştirilen çalışmada Chamath’ın liderliğinde sekiz model test edildi. Nerede ve ne zaman yayımlandı? Araştırma, 2026 yılının ikinci yarısında akademik çevrelerde büyük yankı uyandırdı.
Bu çalışma, yapay zeka uzun vadeli görev konusunda sektör için acı bir gerçeklik check’i niteliği taşıyor. Bir ajana bir yıl boyunca birbirine bağlı kararlar, gecikmeli geri bildirimler ve geçmiş eylemlerinin sonuçları verildiğinde, performansı insanlara kıyasla dramatik biçimde düşüyor.
Sekiz Öncü Model Test Edildi: GPT-5.6 Sol ve Claude Opus 4.8 Dahil
Araştırmacılar, aralarında GPT-5.6 Sol ve Claude Opus 4.8‘in de bulunduğu sekiz önde gelen yapay zeka modelini uzun vadeli görev simülasyonlarında test etti. Modeller, bir yıl boyunca süren karmaşık karar süreçlerine tabi tutuldu. Her bir model, gecikmeli geri bildirimlerle başa çıkmak ve geçmiş eylemlerinin sonuçlarıyla yüzleşmek zorunda kaldı.
Testlerin en çarpıcı sonucu şu oldu: En iyi performans gösteren yapılandırma olan Qwen3.7-Max ile Hermes kombinasyonu bile, ortalama insan katılımcısının kazandığı paranın yalnızca yüzde 27,3’ünü elde edebildi. Bu rakam, yapay zekanın uzun vadeli planlama ve uygulama konusunda ne kadar uzağında olduğunu gözler önüne seriyor.
Stanford AI Club’dan Sert Eleştiri: “Uzun Vadeli Görevler Hâlâ Bir Şaka”
Stanford AI Club’dan Chamath, araştırma bulgularını değerlendirirken oldukça sert bir dil kullandı. Chamath’ın ifadesiyle: “Uzun vadeli görevler hâlâ bir şaka. Bunlar işlemiyor.” Bu açıklama, yapay zeka ajanlarının kısa vadeli görevlerdeki başarılarının uzun vadeli senaryolara transfer edilemediğini ortaya koyuyor.
Chamath ayrıca, yapay zeka geliştirme döngüsünde hayal kırıklığı çukurunun (trough of disillusionment) bu alanda yaşandığına dikkat çekti. Yani yapay zeka sektörü, uzun vadeli ajan yetenekleri konusunda henüz olgunlaşma aşamasına gelmiş değil. Popüler beklentilerin aksine, mevcut modeller yıllık süreli görevlerde güvenilir bir şekilde çalışmaktan çok uzak.
Yüzde 27,3 Performans: Yapay Zeka Hâlâ Olgunlaşmadı
Bir yıl süren bir görevi ortalama insan performansının yalnızca çeyreğiyle tamamlayan bir sistem, güvenilir uzun vadeli yürütme açısından hâlâ çok yetersiz. Araştırmacıların vurguladığı üzere, yapay zeka ajanları gecikmeli geri bildirim mekanizmalarıyla başa çıkmakta ve kendi geçmiş eylemlerinin sonuçlarını doğru şekilde değerlendirmekte zorlanıyor.
Bu bulgular, yapay zeka ajanlarının eğitim ortamları konusunda yapılan son araştırmalarla paralel bir tablo çiziyor. Yapay zeka ajanlarının karmaşık görevlerdeki başarısı, yalnızca model kapasitesine değil, aynı zamanda eğitim ortamlarının kalitesine ve geri bildirim mekanizmalarının tasarımına da bağlı.
Sektör İçin Dersler: Hayal Kırıklığı Çukuru Mu, Yoksa Gelecek Vadisi Mi?
Bu araştırma, açık kaynak multi-agent sistemlerinin gelişimiyle birlikte değerlendirildiğinde önemli soruları gündeme getiriyor. Yapay zekanın uzun vadeli görevlerdeki başarısızlığı, yalnızca bir model sorunu değil; daha geniş bir mimari ve eğitim paradigması sorunu olarak karşımıza çıkıyor.
Sonuç olarak, yapay zeka ajanlarının bir yıl gibi uzun bir zaman diliminde güvenilir bir şekilde çalışabilmesi için önümüzdeki dönemde önemli iyileştirmelere ihtiyaç var. Mevcut sonuçlar, sektörün uzun vadeli ajan yetenekleri konusunda daha temkinli beklentiler belirlemesi gerektiğini gösteriyor. Otomatik ajan optimizasyonu alanındaki gelişmeler umut vadetse de, bu araştırma gösteriyor ki yapay zeka uzun vadeli görev konusunda hâlâ bir çocukluk döneminde.
Henüz yorum yok. İlk yorumu siz yapın!