CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
16 Sep 2026 · 00:16 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
GüVENLIK SAYI #2.613 16 Eyl 2026 · Çarşamba

Trail of Bits: 1Password’ün AI yama benchmark’ı yanıltıcı

Trail of Bits, 1Password'ün 6 Ağustos 2026 tarihli FLAWED raporundaki «modeller yalnızca yüzde 26 temiz yama üretti» manşetinin savunucuları yanıltabileceğini savundu.

AiHaber Editör
Editör
2DK

★ Hızlı Özet

  • Trail of Bits, 1Password'ün 6 Ağustos 2026 tarihli FLAWED raporundaki «modeller yalnızca yüzde 26 temiz yama üretti» manşetinin savunucuları yanıltabileceğini savundu.
  • Manşeti bozan deney seçimleri Altı zafiyet, düzeltilmesi zor olduğu için seçilmiş; temiz-fix oranları yüzde 3–60 arasında. Verinin yüzde 22'…
  • İnsan yama kalitesi ve Patch the Planet Trail of Bits, 2024–2026 arasında 236 değerlendirmede 2.265 zafiyetin ilk insan yamasını inceledi: y…
  • Yazıyla birlikte post-patch-validation ve review-walkthrough ajan becerileri de yayımlanıyor.

Trail of Bits, 1Password’ün 6 Ağustos 2026 tarihli FLAWED raporundaki «modeller yalnızca yüzde 26 temiz yama üretti» manşetinin savunucuları yanıltabileceğini savundu. Ekip, bu oranın bilerek yanlış düzeltme isteyen istemler ve derleme/test yasaklayan denemelerle şişirildiğini yazıyor.

Manşeti bozan deney seçimleri

Altı zafiyet, düzeltilmesi zor olduğu için seçilmiş; temiz-fix oranları yüzde 3–60 arasında. Verinin yüzde 22’si yanlış düzeltme istemli; yüzde 36’sı test yasaklı. GPT-5.5 medium, Opus 4.8 high varsayılan çabayla çalıştırılmış; en yüksek ayarlar denenmemiş. Trail of Bits’in yeniden analizinde, ajanların kod çalıştırabildiği ve yanlış düzeltme emri almadığı denemelerde 3.067 yamanın 2.634’ü (yüzde 86) verilen exploit’i engellemiş.

İnsan yama kalitesi ve Patch the Planet

Trail of Bits, 2024–2026 arasında 236 değerlendirmede 2.265 zafiyetin ilk insan yamasını inceledi: yüzde 12,5 (sekizde bir) ilk denemede sorunu tam çözmemiş. Patch the Planet kapsamında 14 Eylül 2026’ya kadar birleştirilmiş veya kapatılmış 186 PR’dan 126’sı (yüzde 67,7) merge edilmiş; merge edilenlerin yüzde 72,2’sinde güvenlik açısından anlamlı revizyon görülmemiş.

Yazıyla birlikte post-patch-validation ve review-walkthrough ajan becerileri de yayımlanıyor.

Kaynak: Trail of Bits – 1Password’s AI patching benchmark is misleading

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları