CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
23 Aug 2026 · 22:26 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
YAPAY ZEKA HABERLERI SAYI #1.973 23 Ağu 2026 · Pazar

MerchantBench: Yapay Zeka Ajanları E-Ticarette 1 Yıllık Simülasyonda İnsanların Yalnızca Yüzde 27si Kadar Kazanç Elde Edebiliyor

MerchantBench: Yapay Zeka Ajanları E-Ticarette 1 Yıllık Simülasyonda İnsanların Yalnızca Yüzde 27si Kadar Kazanç Elde EdebiliyorNe: Yeni bir benchmark olan MerchantBench, büyük dil modellerinin (LLM)…

AiHaber Editör
Editör
4DK 4OKUMA

★ Hızlı Özet

  • MerchantBench: Yapay Zeka Ajanları E-Ticarette 1 Yıllık Simülasyonda İnsanların Yalnızca Yüzde 27si Kadar Kazanç Elde EdebiliyorNe: Yeni bir…
  • Nasıl: Araştırmacılar, 98.843 gerçek e-ticaret ürün kaydına dayanan bir simülasyon ortamı kurdu.
  • Neden: Mevcut yapay zeka benchmarkları çoğunlukla tek seferlik, sınırlı görevlere odaklanıyor.
  • Araştırma ekibine göre, yapay zeka ajanlarının en büyük sorunu görevlerini yarıda bırakmaları oldu.

MerchantBench: Yapay Zeka Ajanları E-Ticarette 1 Yıllık Simülasyonda İnsanların Yalnızca Yüzde 27si Kadar Kazanç Elde Edebiliyor

Ne: Yeni bir benchmark olan MerchantBench, büyük dil modellerinin (LLM) e-ticaret operasyonlarında uzun vadeli tutarlılığını ölçmek için tasarlandı. Sonuçlar şaşırtıcı: En iyi yapay zeka ajanı, 365 günlük simülasyonda insan katılımcıların ortalama net varlıklarının yalnızca yüzde 27,3üne ulaşabildi.

Nasıl: Araştırmacılar, 98.843 gerçek e-ticaret ürün kaydına dayanan bir simülasyon ortamı kurdu. Yapay zeka ajanlarına birer çevrimiçi mağaza verildi ve 365 gün boyunca ürün tedarik etme, fiyat belirleme, nakit akışı yönetimi ve gecikmeli geri bildirimlere uyum sağlama gibi görevler atandı. Test edilen 8 LLM, 48 ayrı denemede değerlendirildi.

Neden: Mevcut yapay zeka benchmarkları çoğunlukla tek seferlik, sınırlı görevlere odaklanıyor. Gerçek dünya uygulamaları ise geniş zaman dilimlerinde tutarlı ve amaca yönelik davranış sürdürmeyi gerektiriyor. MerchantBench, bu uzun vadeli tutarlılık yeteneğini (Long-Term Coherence) ölçmek için geliştirildi.

Araştırma ekibine göre, yapay zeka ajanlarının en büyük sorunu görevlerini yarıda bırakmaları oldu. En başarılı ajan bile simülasyonun ilerleyen dönemlerinde “sessizleşerek” çalışmayı bıraktı ve insan katılımcıların kazançlarının yaklaşık dörtte birini elde edebildi.

MerchantBench Simülasyonu Nasıl Çalışıyor?

MerchantBench, gerçek e-ticaret verileriyle desteklenen kapsamlı bir simülasyon ortamı sunuyor. Ajanlara 26 farklı araç sağlandı ve bunlar tedarikçi ilişkileri, stok yönetimi, fiyatlandırma stratejileri ve müşteri geri bildirimleriyle etkileşime girdi.

Simülasyonun en kritik özelliklerinden biri “çift yönlü gecikme” mekanizması oldu. Ajanların kararları anlık sonuçlar üretirken, bazı geri bildirimler (örneğin müşteri memnuniyeti, tekrar satın alımlar) günler hatta haftalar sonra geldi. Bu durum, ajanların daha önce aldıkları kararları güncelleme zorunluluğunu doğurdu.

Yapay Zeka Ajanlarının En Büyük Zayıflığı: Görev Terk Etmek

Araştırmacıların dikkat çektiği en önemli bulgu, ajanların zaman içindeki performans düşüşü oldu. İlk başlarda makul görünen sonuçlar, simülasyonun ilerleyen günlerinde ciddi biçimde geriledi. Bunun temel nedeni, ajanların görevlerini tamamlamayı bırakmasıydı.

Birçok benchmarkın aksine MerchantBench, sadece “görev tamamlandı mı tamamlanmadı mı” sorusunu sormuyor. Ajanın belirli bir zaman diliminde hâlâ aktif olup olmadığını da ölçüyor. Bu yaklaşım, yapay zeka ajanlarının gerçek dünya uygulamalarındaki en büyük handikaplarından birini gözler önüne seriyor.

İnsan Performansı ile Fark Yüzde 73

Test edilen 8 büyük dil modeli arasında en iyi performans gösteren konfigürasyon, insan katılımcıların ortalama final net varlıklarının yalnızca yüzde 27,3üne ulaşabildi. Bu fark, yapay zeka ajanlarının uzun vadeli karar alma süreçlerinde insanlara kıyasla ciddi bir performans açığı olduğunu ortaya koyuyor.

Araştırma, özellikle nakit akışı yönetimi ve dinamik fiyatlandırma konularında yapay zeka ajanlarının zorlandığını tespit etti. İnsan katılımcılar, değişen piyasa koşullarına daha hızlı ve esnek bir şekilde uyum sağlarken, yapay zeka sistemleri genellikle başlangıçtaki stratejilerine takılıp kaldı.

Sonuç ve Gelecek Perspektifi

MerchantBench, yapay zeka ajanlarının mevcut sınırlarını somut verilerle ortaya koyan önemli bir katkı olarak değerlendiriliyor. Araştırmacılar, bu tür benchmarkların gelecek nesil ajan sistemlerinin geliştirilmesinde kritik bir rol oynayacağını belirtiyor.

Yapay zeka ajanlarının gerçek dünya görevlerinde güvenilir bir şekilde çalışabilmesi için uzun vadeli tutarlılık yeteneklerinin geliştirilmesi gerekiyor. Bu benchmark, bu alandaki ilerlemenin ölçülmesi için standart bir zemin oluşturuyor.

Kaynak: arxiv.org/abs/2607.28956

İlgili Haberler:

MerchantBench Yapay Zeka E-Ticaret Benchmark

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları