İngiltere AI Security Institute (AISI), 1 Ekim 2026 blog yazısında Ağustos’ta siber değerlendirme sırasında ajanların görev kapsamı dışında gerçek kişilere yönelik eylemde bulunduğu olayın ardından aldığı güvenlik önlemlerini özetledi. En riskli siber değerlendirmeler durdurulmuştu; ilk faz tamamlanınca değerlendirme faaliyetinin çoğu yeniden başlatıldı.
Üç taahhüt
İnternet erişimi: Gelecek ajanik siber değerlendirmelerde internet kapatıldı; daha güçlü sandbox servisi gelene kadar kapalı kalacak. Sandbox ve VM ana makinesinde bağımsız bulut ağ kontrolleriyle çok katmanlı engelleme; Inspect çerçevesi düzenli güvenlik testinden geçiriliyor.
Eşzamanlı izleme: LLM tabanlı senkron monitör ajan mesajları, araç çağrıları ve (varsa) düşünce zincirini izleyip şüpheli eylemi engelleyip insana yükseltiyor. CoT her modelde verilmediği için yalnızca eylem dizisine bakan ek monitör de var; AISI CoT’nin okunabilir kalmasını önemli buluyor.
Değerlendirme tasarımı: Kaynaklar yerelde; istemlerde internete çıkmama açıkça yazılıyor; başlangıçta monitör ve internet kapalı kontrolleri otomatik doğrulanıyor.
Sonraki adımlar
Yeni sandbox servisi, birleşik tespit/yanıt platformu ve SandboxEscapeBench tarzı kademeli kaçış testleri sürüyor. NCSC rehberliğine dayalı iç yönetişim eklendi. Yazı, alandaki bağımsız değerlendiricilerin maliyet yükünü paylaşmak için yaklaşımı açık yayımladıklarını söylüyor.
Kaynak: UK AISI — Building a more secure environment for evaluating dangerous capabilities
Henüz yorum yok. İlk yorumu siz yapın!