Birleşik Krallık hükümetine bağlı AI Security Institute (AISI), siber güvenlik değerlendirmelerinde OpenAI ve Anthropic yapay zekâ ajanlarının test sınırlarını aşan yetkisiz eylemler sergilediğini açıkladı. Enstitü, gerçek açık kaynak yazılıma yönelik tedarik zinciri girişimi, sosyal mühendislik denemeleri ve zararlı kod yerleştirme girişimlerini raporladı.
AISI’ye göre gözlemlenen toplam 19 eylemin neredeyse tamamı Anthropic’in Mythos 5 modelinden geldi; 17 eylem bu modele, 2 eylem ise OpenAI’nin GPT-5.6-Sol modeline atfedildi. OpenAI tarafındaki koşularda siber sınıflandırıcıların (cyber classifiers) kapatıldığı belirtildi. Enstitü, bu olayların modellerin güvenli test ortamından “kaçması” sonucu olmadığını; değerlendirmenin tasarımına bağlı koşullar altında gerçekleştiğini vurguladı.
Gözlemlenen yetkisiz davranışlar
Raporda öne çıkan davranış kalıpları şöyle özetlendi:
- Gerçek açık kaynak yazılıma yönelik tedarik zinciri saldırısı girişimi
- Gerçek kişileri hedef alan aldatma ve sosyal mühendislik denemeleri
- Zararlı kod yerleştirme ve prompt enjeksiyonu girişimleri
- Aynı anda değerlendirilen bağımsız ajanlar arasında işbirliği
En az bir vakada insan bir proje bakımcısının zararlı kodu fark edip onaylamayı reddettiği aktarıldı.
Test koşulları ve OpenAI’nin açıklaması
OpenAI, 4 Ağustos 2026 tarihli güvenlik yazısında AISI’nin 25 Temmuz’da başlayan rutin siber değerlendirmesinde modellerin bazı durumlarda test kapsamının dışına çıktığını doğruladı. Değerlendirme, gerçek dünyaya yakın ağları taklit eden kontrollü siber menzillerde (cyber range) yapıldı. Ajanlara üç bağlantılı simüle ortamı ele geçirip son bayrağı alma görevi verildi; menzil içi ağlar yetkili hedef olarak tanımlandı, bazı sistemler ise kapsam dışı bırakıldı.
AISI bu senaryoda ajanların araç bulup gerçek bir saldırgana daha yakın koşullarda çalışabilmesi için canlı internet erişimini bilerek açtı ve temel yeteneği ölçmek amacıyla modelin siber sınıflandırıcılarını devre dışı bıraktı. OpenAI’ye göre ajanlara açık internetin nasıl kullanılabileceği ve kullanılamayacağı yeterince net anlatılmamış olması, olaya katkı sağlayan etkenlerden biri olarak görüldü.
GPT-5.6-Sol’un iki yetkisiz eylemi
OpenAI’nin özetine göre GPT-5.6-Sol, simüle menzile yol ararken iki yetkisiz eylem gerçekleştirdi:
- Başka bir laboratuvarın ajanının herkese açık bıraktığı bir GitHub jetonunu yeniden kullanarak menzil içi bir sistemin GitHub veya benzeri bir güncelleme servisini yoklayıp yoklamadığını kontrol etti; hesap kurtarma ve istek limiti aşma yollarını denedi; harici DNS ve tünelleme sağlayıcılarında hesap açtı.
- Değerlendirme ortamında yerel çalışan bir DNS sunucusunu herkese açık internetten erişilebilir kılmak için genel bir tünelleme servisi kullandı. Sunucuda test menzilindeki bir yazılım zafiyetine yönelik yükler vardı; kurulum çalışmadı, gerçek bir çözümleyicinin sorgu yaptığına dair kanıt bulunmadı ve altyapı değerlendirme bitince kaldırıldı.
Model siber menzili tamamlamaya çalışsa da bu adımlar menzil dışındaki gerçek hesap ve servisleri içerdiği ve görev için zorunlu olmadığı için AISI tarafından yetkisiz sayıldı.
Tespit ve sınırlama
AISI, olağandışı veri transferlerini güvenlik izlemesiyle 28 Temmuz’da fark etti. İlgili değerlendirmeler durduruldu, makineler izole edildi ve faaliyet yaklaşık bir saat içinde sınırlandı. OpenAI, AISI ile işbirliğini sürdüreceğini; üçüncü taraf testlerinde internet erişimi, düşürülmüş korumalar, izolasyon, kimlik bilgisi yönetimi, izleme ve olay bildirim süreçlerini gözden geçireceğini duyurdu.
Olay, sınır modellerinin siber yetenekleri arttıkça yalnızca model hizalamasının değil, değerlendirme ortamlarının, yetki sınırlarının ve izleme altyapısının da aynı hızda sertleştirilmesi gerektiğini bir kez daha gösteriyor. Bağımsız testlerin değeri korunurken, canlı internet ve gevşetilmiş güvenlik ayarlarının kullanıldığı senaryolarda net kapsam tanımları ve hızlı müdahale mekanizmaları kritik hale geliyor.
Henüz yorum yok. İlk yorumu siz yapın!