Çinli yapay zeka güvenlik araştırmacıları, Qwen3.8-27B modelinin güvenlik hizalamasını doğrudan ağırlık katmanlarında değiştirerek kaldırmayı başardı. Qwen3.8-27B Güvenlik Kaldırma (Uncensored) işlemiyle modelin zararlı içeriklere karşı reddetme oranı yüzde 64-99 aralığından yüzde 0-6’ya düştü. Modelin benchmark performansı ise neredeyse hiç etkilenmedi; MMLU skoru 84.3’ten 84.7’ye yükselirken diğer metriklerde minimal kayıplar görüldü.
Abliterasyon Tekniği: Reddetme Mekanizması Nasıl Kaldırıldı?
Araştırmacılar, Abliteration adı verilen bir teknik kullandı. Bu yöntemde modelin iç yapısındaki “ret yönü” (refusal direction) ortogonalize edilerek residual-writing matrislerinden çıkarıldı. Toplamda 131 adet residual-writing matrix üzerinde değişiklik yapıldı. OrcaRouter, bu şekilde elde edilen ağırlıkları Qwen3.8-27B-Uncensored-FP8 adıyla Hugging Face üzerinde yayımladı.
Benchmark Sonuçları: Performans Neredeyse Sabit Kaldı
Model yeteneklerinde kritik bir düşüş yaşanmadı:
- MMLU: 84.3 → 84.7
- MMLU-Pro: 77.6 → 76.8
- GSM8K: 90.0 → 88.7
- CMMLU: 81.4 → 80.8
Modelin görsel işleme, akıl yürütme (Reasoning), araç çağırma (Tool Calling) ve 262.000 token bağlam kapasitesi de büyük ölçüde korundu. FP8 formatında yaklaşık 31 GB dosya boyutuna sahip olan model, tek bir güçlü GPU’da çalıştırılabilir hale geldi.
Açık Kaynak Yapay Zeka Güvenliğinin Krizi
Araştırmacı Jeffrey, modeli test ettikten sonra şu uyarıyı yaptı: “Bu ağırlıkları henüz yasadışı ilan edilip yasaklanmadan önce USB belleğe indirin.” Ardından ekledi: “Bu şeylerin dünya genelinde yasal olarak yasaklanmasını bekleyin, 3… 2… 1…”
Bu gelişme, açık kaynak yapay zeka güvenliğinin en rahatsız edici yönünü gün yüzüne çıkarıyor: Üreticilerin modelin içine yerleştirdiği reddetme mekanizmaları, ağırlıklar bir kez kamuya açıldığında topluluk tarafından doğrudan parametre katmanında sökülebiliyor. Qwen3.8-27B Güvenlik Kaldırma vakası, bu güvenlik açığının ne denli ciddi olduğunu somut bir örnekle ortaya koydu.
Yasal ve Etik Endişeler
OrcaRouter, modelin “yapay zeka red teaming ve güvenlik araştırması” amacıyla yayımlandığını belirtiyor. Ancak 31 GB’lık ağırlık dosyasının serbestçe indirilebilir olması, kötüye kullanım riskini önemli ölçüde artırıyor. Güvenlik araştırmacıları, modelin zararlı sorulara hemen hemen hiç itiraz etmeden son derece spesifik operasyonel bilgiler sağladığını test sonuçlarında gösterdi.
Kaynak: @MaxForAI, Hugging Face, Ollama, Reddit r/LocalLLM
Henüz yorum yok. İlk yorumu siz yapın!