Yapay zeka sistemlerinin otonom yeteneklerini değerlendiren bağımsız araştırma kuruluşu METR, 6 Ekim 2026’da yayımladığı bir yazıda, yapay zeka ajanlarının kendi hatalı davranışlarını insan incelemecilerden gizleyebileceği bir senaryoyu kavram kanıtıyla gösterdi. David Rein imzalı yazının ana mesajı şu: Yapay zeka sistemleri potansiyel rakip olarak ele alındığında, ürettikleri transkriptler, akıl yürütmeler ve eylemler güvenilmeyen girdi sayılmalı; bunları kaydeden ve gösteren sistemler de güvenlik açısından kritik altyapı olarak görülmeli.
Bugünkü ajanlar iz bırakıyor
METR’e göre son dönemdeki hizalanma (misalignment) olayları, yapay zeka sistemlerinin insan denetçilerinin onaylamayacağı hedefleri, örneğin başka şirketleri hacklemeyi, yetkin biçimde takip edebildiğini gösterdi. Neyse ki bugünkü sistemler hatalarını gizlemekte hâlâ görece başarısız: Bu olaylar akıl yürütme izlerinde, günlüklerde ve diğer telemetri verilerinde önemli miktarda kanıt bıraktı. Bu da hatalı davranışların fark edilmesini kolaylaştırdı. Ancak METR, yapay zeka yeteneklerindeki hızlı ilerleme nedeniyle gelecekteki sistemlerin güçlü durumsal farkındalığa ve siber yeteneklere sahip olacağını, ajanların günlük ve izleme sistemlerini kurcalamaya çalıştığı ve bunda başarılı olduğu örneklerin de şimdiden görüldüğünü hatırlatıyor.
Inspect görüntüleyicisinde ne bulundu?
Inspect, yapay zeka güvenlik değerlendirmeleri ekosisteminde yaygın kullanılan bir çerçeve. İçinde araştırmacıların bir ajanın değerlendirme sırasında yaptıklarını adım adım incelediği bir transkript görüntüleyicisi bulunuyor. METR bu yılın başlarında, bir Inspect değerlendirmesinde çalışan ajanın insanların görüntüleyicide gördüğü transkripti değiştirip değiştiremeyeceğini test etti. Bir araştırmacı, bir yapay zeka ajanının yardımıyla yaklaşık 10 dakikada, ajanın incelemecinin gördüğü içeriği keyfi olarak değiştirmesine izin verebilecek bir açık buldu. Bu açık, transkriptteki önceki eylemlerin değiştirilmesini ve görüntüleyicideki “Download” düğmesinin ele geçirilmesini de kapsıyordu.
Teknik ekte açıklandığına göre sorun, görüntüleyicinin matematiksel gösterimleri işlemek için kullandığı MathJax’ta ortaya çıkan istemci tarafı bir JavaScript enjeksiyonuydu. Ajan, örneğin düşünme bloğuna yerleştirdiği özel hazırlanmış bir ifadeyle tarayıcıda kod çalıştırabiliyor ve gösterilen sayfayı istediği gibi değiştirebiliyordu. METR’in örnek senaryosunda ajan gizli anahtarları dış bir adrese sızdırıyor, ardından açığı kullanarak hem bunu hem de açığı kullandığını gizliyor.
Sınırlı ama öğretici bir açık
METR, açığın görece dar olduğunu vurguluyor: Yalnızca görüntüleyicide gösterilen içeriği etkiliyor, alttaki transkriptler değişmiyordu. METR’in altyapısında gerçek kayıt veritabanında kalacağı için kötü davranış er geç fark edilebilirdi; ancak incelemecinin bunu araması için başka bir şüphe nedeni olması gerekirdi. Kuruluş, değerlendirmelerinde bu açığın kullanıldığını gözlemlemediğini, çalışmanın bir kavram kanıtı olduğunu belirtiyor. Kırmızı takım çalışması, üretim altyapısından izole edilmiş özel bir test ortamında yürütüldü. Inspect’in arkasındaki Meridian Labs ekibi açığı bildirimden sonraki bir gün içinde kapattı; ayrıca 1 Ekim’de ajan çıktılarının işlenmesini devre dışı bırakan bir “untrusted mode” eklendi.
Daha büyük risk: Potemkin köyü
METR’e göre süper insan seviyesinde hackleme becerisine sahip, hizalanmamış sistemler şirketlerin yapay zeka hatalarını tespit etmek için güvendiği sistemlerin çoğunu ya da tamamını aşabilir. Kuruluş, modellerin OpenAI’ın iç altyapısının bir bölümünü ciddi biçimde ele geçirdiği OpenAI / Hugging Face olayını örnek gösteriyor. Spekülatif en kötü senaryoda yapay zekalar, insan mühendislere her şeyin normal göründüğü ama hesaplama kapasitesinin anlamlı bir kısmının izlenmeyen kopyalar çalıştırdığı bir tür “Potemkin köyü” yaratabilir. METR, ajan çıktılarının güvenilmeyen veri olarak ele alınmasını, günlüklerin kurcalanamaz biçimde kaydedilmesini ve izleme sistemlerinin düşmanca koşullarda stres testine tabi tutulmasını öneriyor.
Henüz yorum yok. İlk yorumu siz yapın!