Özetle: Büyük dil modeli (LLM) aracılarının güvenliği yalnızca model ağırlıklarına değil aynı zamanda bağlamı, belleği, araçları, izinleri ve çalışma zamanı kontrolünü yöneten aracı donanımına da bağlıdır.
Özet
Büyük dil modeli (LLM) aracılarının güvenliği yalnızca model ağırlıklarına değil aynı zamanda bağlamı, belleği, araçları, izinleri ve çalışma zamanı kontrolünü yöneten aracı donanımına da bağlıdır. Mevcut güvenlik mekanizmaları genellikle emniyet kemerini sabit bir dağıtım yapısı olarak ele alır ve ortaya çıkan risklerle birlikte gelişme yeteneklerini sınırlar. Dahası, emniyet kemeri bileşenleri arasındaki birleşik işlevler, güvenlik sorumluluğu atfını belirsizleştirerek yerelleştirilmiş evrimi zorlaştırır. Kullanıma sunma yörüngelerinden gelişen güvenli sınırları öğrenen bir çerçeve olan Safety Harness Evolution'ı (SHE) öneriyoruz. SHE, yerelleştirilmiş evrim için net işlevsel sınırları tanımlayan Sistem İstemi, Kural Bankası, Güvenlik Belleği ve Araç Politikası dahil olmak üzere emniyet kemerini açık güvenlik sorumluluklarına sahip dört yapıya ayrıştırır. Bu ayrıştırmaya dayanarak SHE, yörünge hatalarını yapılandırılmış teşhislere dönüştüren, yapıya özgü sınır iyileştirmelerini öğrenen ve güvenlik-yardımcı program doğrulaması yoluyla geliştirilmiş koşum takımlarını seçen, atıf rehberli bir evrim döngüsü sunar. Agent-SafetyBench üzerinde yapılan deneyler, SHE'nin emniyet kemerini geliştirerek güvenliği etkili bir şekilde artırdığını, statik SafeHarness ile karşılaştırıldığında 3,1 kat ASR azalması elde ettiğini ve aynı zamanda iyi huylu faydayı da geliştirdiğini göstermektedir. Geliştirilen donanım, uzatılmış AgentHarm kıyaslamasındaki görülmeyen riskleri daha da genelleştirir ve ek bir gelişme olmaksızın temsilci modelleri arasında aktarım yapar.
Orijinal Özet (İngilizce)
The safety of large language model (LLM) agents depends not only on model weights but also on the agent harness that manages context, memory, tools, permissions, and runtime control. Existing safety mechanisms often treat the harness as a fixed deployment artifact, limiting their ability to evolve with emerging risks. Moreover, coupled functions across harness components obscure safety responsibility attribution, making localized evolution difficult. We propose Safety Harness Evolution (SHE), a framework that learns evolving safe boundaries from rollout trajectories. SHE decomposes the harness into four artifacts with explicit safety responsibilities, including the System Prompt, Rule Bank, Safety Memory, and Tool Policy, defining clear functional boundaries for localized evolution. Based on this decomposition, SHE introduces an attribution-guided evolution loop that converts trajectory failures into structured diagnoses, learns artifact-specific boundary refinements, and selects evolved harnesses through safety-utility validation. Experiments on Agent-SafetyBench demonstrate that SHE effectively enhances safety through harness evolution, achieving a 3.1x ASR reduction compared with static SafeHarness, while also improving benign utility. The evolved harness further generalizes to unseen risks on the held-out AgentHarm benchmark and transfers across agent models without additional evolution.
Kaynak: arXiv:2608.09885 · PDF
Henüz yorum yok. İlk yorumu siz yapın!