OpenAI, modellerinin korumalı muhakemesini (protected reasoning) sistematik olarak çıkarmaya yönelik örgütlü bir kampanyayı tespit edip engellediğini açıkladı. En erken gözlenen etkinlik Temmuz’un ilk haftasına dayanıyor; davranış adversarial distillation ile uyumlu tanımlanıyor.
Ne yapıldı, ne yapılmadı?
Şirkete göre operatörler şifrelemeyi kırmadı, veritabanını ele geçirmedi veya saklı kullanıcı konuşmalarına doğrudan erişmedi. Bunun yerine model etkileşimlerini manipüle ederek korumalı muhakemeyi talep eden tarafa görünür biçimlerde yeniden ürettiler; bu, hizmet şartlarını ihlal eden ölçekli bir kullanım olarak anlatılıyor. OpenAI, tekniğin yalnızca kendine özgü olmadığını ve Frontier Model Forum üzerinden ortak savunmayı güçlendirdiğini yazıyor.
Ölçek ve atıf
- 24–25 Temmuz’da ilgili çıkarma kalıbıyla 4.000’den fazla kullanıcıdan 16.000 istek spike’ı
- İlgili istem kalıbı kümesi: 15.000’den fazla kullanıcı; 28 Temmuz’a kadar tam engelleme
- Tüm operatörlerin tek aktörden geldiği net değil; çekirdek küme Moonshot AI (Kimi geliştiricisi) ile ilişkilendirilen bireylere atfediliyor
OpenAI, çıkarılan muhakemenin güvenlik önlemleri korunmadan başka modele aktarılmasının güvenlik ve ulusal güvenlik riskleri taşıdığını savunuyor.
Kaynak: OpenAI: Disrupting a coordinated model-distillation campaign
Henüz yorum yok. İlk yorumu siz yapın!