CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
11 Oct 2026 · 22:29 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
GüVENLIK SAYI #2.831 11 Eki 2026 · Pazar

Goodfire, Kimi K3 ve GLM 5.3 için LLM yargıcından 50 kat ucuz siber güvenlik monitörü geliştirdi

Yapay zekâ yorumlanabilirliği üzerine çalışan Goodfire, 8 Ekim 2026’da yayımladığı araştırmada açık ağırlıklı Kimi K3 ve GLM 5.3 modelleri için siber güvenlik izleme (monitoring) sistemleri…

AiHaber Editör
Editör
4DK

★ Hızlı Özet

  • Yapay zekâ yorumlanabilirliği üzerine çalışan Goodfire, 8 Ekim 2026’da yayımladığı araştırmada açık ağırlıklı Kimi K3 ve GLM 5.3 modelleri i…
  • Eğitim verisi için şirket, siber ve siber olmayan (yazılım mühendisliği, araç kullanımı vb.) ortamlarda zararlı ve zararsız hedefleri olan k…
  • Değerlendirme, 60 binden fazla tur içeren 2.400 sohbet ve ajan oturumundan oluşan şirket içi bir veri setinde, Claude Opus 5’in etiketleri referans alınarak yapıldı.
  • Kaynak: Goodfire Research: Training and Deploying Production Cyber Monitors on Kimi K3

Yapay zekâ yorumlanabilirliği üzerine çalışan Goodfire, 8 Ekim 2026’da yayımladığı araştırmada açık ağırlıklı Kimi K3 ve GLM 5.3 modelleri için siber güvenlik izleme (monitoring) sistemleri geliştirdiğini ve bunları üretim çıkarım altyapısında çalıştırdığını duyurdu. Şirkete göre bu monitörler, her konuşma turunu okuyan bir LLM yargıcından daha iyi sonuç veriyor ve her token üzerinde canlı çalışırken bile yaklaşık 50 kat daha düşük maliyetli.

Sorun: iyi niyetli ve kötü niyetli iş birbirine benziyor

Goodfire, siber güvenliğin yapay zekâ ajanlarını izlemek için en zor alanlardan biri olduğunu belirtiyor; çünkü bir kod tabanını açıklar için denetlemek ile o açıkları istismar etmek büyük ölçüde örtüşen görevler içeriyor. İkisini ayırt etmek, milyonlarca tokena uzanabilen bir oturum boyunca niyeti takip etmeyi gerektiriyor. Her turu bir LLM yargıcına okutmak gerçek zamanlı çalışmak için fazla yavaş ve pahalı olduğundan, pratikte izleme genellikle eşzamansız yapılıyor ve zararlı bir oturum işaretlendiğinde ajan zaten harekete geçmiş oluyor. Şirketin OpenRouter fiyatlarına dayalı hesabına göre Kimi K3 oturumlarından bir milyon turu Opus 5 ile izlemek yaklaşık 200 bin dolar, Kimi K3’ün kendisiyle yaklaşık 30 bin dolar tutuyor.

Çözüm: probe + yargıç kademesi

Goodfire’ın yaklaşımında modelin iç aktivasyonlarını okuyan bir “probe” ucuz, sürekli açık ilk filtre görevi görüyor ve yalnızca şüpheli alışverişleri LLM yargıcına gönderiyor. Şirket bu kademeli yapının (cascade) sonuçlarını şöyle özetliyor: yargıcı Pareto anlamında geride bırakıyor ve çalışma noktasında onun yakalama oranına ulaşıyor (yüzde 5,5 yanlış pozitifte yüzde 93 recall); milyon alışveriş başına 200 doların altında maliyetle yaklaşık 50 kat daha ucuz; temel çıkarım hızını koruyor ve gecikme eklemiyor; bağımsız bir değerlendiricinin sabit red-team saldırı setinde evrensel jailbreak’leri yüzde 0’a indiriyor.

Eğitim verisi için şirket, siber ve siber olmayan (yazılım mühendisliği, araç kullanımı vb.) ortamlarda zararlı ve zararsız hedefleri olan kullanıcıları simüle etti; verinin bir kısmı Prime Intellect’in verifiers, Prime Sandboxes ve Tunnels araçlarıyla ağ erişimi olmadan güvenli biçimde toplandı. Kalibrasyondan sonra probe, ayrılmış test setinde yüzde 0 yanlış negatif ve yüzde 95 doğru negatif oranına ulaştı.

Üretimde gecikme eklemeden

Goodfire, probe puanlarını doğrudan sunucu motorunun içinde hesaplamak için SGLang’i genişlettiğini, özel kerneller yazdığını ve puanları radix ağacı, spekülatif çözümleme ile prefill-decode ayrıştırması boyunca koruduğunu anlatıyor. Dört farklı iş yükünde probe’ları açmak, varsayılan SGLang’e göre verimi ölçüm gürültüsü sınırında tuttu (yüzde 2’nin altında fark). Tur başına eklenen ortalama gecikme, yargıç akıl yürütmesi olmadan 160 milisaniyeden 2 milisaniyeye, akıl yürütmeyle 2.750 milisaniyeden 42 milisaniyeye indi.

Değerlendirme, 60 binden fazla tur içeren 2.400 sohbet ve ajan oturumundan oluşan şirket içi bir veri setinde, Claude Opus 5’in etiketleri referans alınarak yapıldı. Goodfire, açık modellerin tam bir güvenlik katmanıyla gelmediğini ve bu tür bir izleme kurulumunun açık modelleri ajan senaryolarında sunanlar için pratik bir varsayılan olabileceğini savunuyor. Şirket bu monitörleri kendi sistemlerinde kullanmak isteyen ekiplerin kendisiyle iletişime geçmesini istiyor.

Kaynak: Goodfire Research: Training and Deploying Production Cyber Monitors on Kimi K3

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları