Trail of Bits, 1Password’ün 6 Ağustos 2026 tarihli FLAWED raporundaki «modeller yalnızca yüzde 26 temiz yama üretti» manşetinin savunucuları yanıltabileceğini savundu. Ekip, bu oranın bilerek yanlış düzeltme isteyen istemler ve derleme/test yasaklayan denemelerle şişirildiğini yazıyor.
Manşeti bozan deney seçimleri
Altı zafiyet, düzeltilmesi zor olduğu için seçilmiş; temiz-fix oranları yüzde 3–60 arasında. Verinin yüzde 22’si yanlış düzeltme istemli; yüzde 36’sı test yasaklı. GPT-5.5 medium, Opus 4.8 high varsayılan çabayla çalıştırılmış; en yüksek ayarlar denenmemiş. Trail of Bits’in yeniden analizinde, ajanların kod çalıştırabildiği ve yanlış düzeltme emri almadığı denemelerde 3.067 yamanın 2.634’ü (yüzde 86) verilen exploit’i engellemiş.
İnsan yama kalitesi ve Patch the Planet
Trail of Bits, 2024–2026 arasında 236 değerlendirmede 2.265 zafiyetin ilk insan yamasını inceledi: yüzde 12,5 (sekizde bir) ilk denemede sorunu tam çözmemiş. Patch the Planet kapsamında 14 Eylül 2026’ya kadar birleştirilmiş veya kapatılmış 186 PR’dan 126’sı (yüzde 67,7) merge edilmiş; merge edilenlerin yüzde 72,2’sinde güvenlik açısından anlamlı revizyon görülmemiş.
Yazıyla birlikte post-patch-validation ve review-walkthrough ajan becerileri de yayımlanıyor.
Kaynak: Trail of Bits – 1Password’s AI patching benchmark is misleading
Henüz yorum yok. İlk yorumu siz yapın!