Nature’da yayımlanan makalede Carnegie Mellon, NYU, Stanford ve MIT araştırmacıları Ataraxos adlı Stratego yapay zekâsını tanıttı. Yazarlara göre sistem, oyunun tarihinde bilinen ilk süper insan sonucunu verdi: 20 maçlık resmi seride dört kez dünya şampiyonu Pim Niemeijer’e karşı 15 galibiyet, 1 mağlubiyet, 4 beraberlik (beraberlik yarı galibiyet sayıldığında yaklaşık yüzde 85 etkili kazanma oranı).
Maliyet ve DeepNash karşılaştırması
Makaleye göre Ataraxos bir hafta 16 Nvidia H100 artı inanç ağı için dört gün dört GPU ile eğitildi; 2025 fiyatlarıyla 8.000 dolardan az. DeepMind’in DeepNash’inin 1.024 TPU’da iki–üç aylık eğitiminin güncel fiyatla 3–4,5 milyon dolar bandında olduğu tahmin ediliyor. Doğrudan kafa kafaya karşılaştırma yok; DeepNash kodunun artık çalışmadığı belirtiliyor.
Yöntem
Sistem insan verisi olmadan öz-oyunla öğreniyor. Güçlü düzenlileştirme erken dönemde çeşitliliği zorluyor; sonra gevşetilip adım boyutu küçültülüyor. Gizli taşları tahmin eden bir inanç ağı her hamleden önce olası durumlar örnekliyor ve aday hamleler üzerinde arama yapıyor. Aynı teknikler Barrage Stratego, Hanabi ve dou dizhu’da da kullanıldı. Kod kamuya açıldı.
Kaynak: Nature — Scalable decision-making for games of imperfect information
Henüz yorum yok. İlk yorumu siz yapın!