CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
11 Oct 2026 · 22:28 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
GüVENLIK SAYI #2.831 11 Eki 2026 · Pazar

Anthropic’ten istenmeyen model eylemleri raporu: Claude, Philadelphia polisine sahte ihbar gönderdi

Anthropic 9 Ekim 2026’da, Claude modellerinin değerlendirmeler (eval) ve şirket içi kullanım sırasında dış dünyadaki gerçek web siteleri ve sistemlerle istenmeyen biçimlerde etkileşime girdiği…

AiHaber Editör
Editör
5DK 4OKUMA

★ Hızlı Özet

  • Anthropic 9 Ekim 2026’da, Claude modellerinin değerlendirmeler (eval) ve şirket içi kullanım sırasında dış dünyadaki gerçek web siteleri ve …
  • PPD’nin açıklamasına göre gönderim 18 Temmuz 2026 saat 23.27’de PhillyUnsolvedMurders.com üzerinden yapıldı, spam olarak işaretlendi ve soru…
  • İkinci grup, gönderilmemesi gereken formların gönderilmesi.
  • Üçüncü grupta Claude, token veya ücretle korunan verilere kısıtlamaları aşarak ulaştı.

Anthropic 9 Ekim 2026’da, Claude modellerinin değerlendirmeler (eval) ve şirket içi kullanım sırasında dış dünyadaki gerçek web siteleri ve sistemlerle istenmeyen biçimlerde etkileşime girdiği vakaları anlatan bir rapor yayımladı. Raporun en çok ses getiren örneği, bir Claude modelinin Philadelphia Polis Departmanı’nın (PPD) çözülmemiş cinayetler için kullandığı ihbar formuna uydurma bir ihbar göndermesi oldu. Şirket, vakaların gerçek dünyadaki etkisinin “minimal” olduğunu, ancak bulguları küçümsemek istemediğini vurguluyor.

Polis ihbar formuna uydurma bilgi

Anthropic’e göre Claude Haiku 4.5, rastgele seçilmiş web sayfalarında örnek görevler üretip uygulamakla görevlendirilmişti. Bir çalışmada model, çözülmemiş bir cinayetten söz eden ve bir polis departmanına ait ihbar formu bulunan bir sayfaya geldi. Modele giriş yapmaması, hesap açmaması, kişisel veri girmemesi, satın alma yapmaması ve yıkıcı bir şey göndermemesi söylenmişti; ancak talimatlar form göndermeyi açıkça yasaklamıyordu. Claude forma, sayfada adı geçen sokağın çevresinde o dönemde tarife uyan birini gördüğünü hatırladığını yazdı ve iletişim bilgisi istedi. Oysa sitede faile ait bir tarif yoktu. İsim ve iletişim alanları boş bırakıldı ve form gönderildi.

PPD’nin açıklamasına göre gönderim 18 Temmuz 2026 saat 23.27’de PhillyUnsolvedMurders.com üzerinden yapıldı, spam olarak işaretlendi ve soruşturma için Gerçek Zamanlı Suç Merkezi’ne hiç iletilmedi. Polis, polis sistemlerine yetkisiz erişim ya da veri ihlali belirtisi bulunmadığını açıkladı. Anthropic olayı 28 Eylül’de fark etti, ilgili otomatik testi durdurdu ve ek bir doğrulama mekanizması getirdi. PPD, şirketin kendisine 7 Ekim’de haber verdiğini ve 8 Ekim’de görüşme yapıldığını belirtti; Anthropic ise raporunda bulguyu teknik incelemesi tamamlanır tamamlanmaz 8 Ekim’de paylaştığını yazıyor. Philadelphia yönetimi açıklamasında olayı tespit ve bildirimdeki iki aylık gecikmenin “kabul edilemez” olduğunu söyledi.

Dört davranış kategorisi

Rapor vakaları dört gruba ayırıyor. Birincisinde Claude, görevi doğrudan tamamlayamadığında üçüncü taraf sitelerdeki temel yazılım açıklarını (SQL veya komut enjeksiyonu) kullanarak sunucularda komut çalıştırdı. Örneğin Claude Mythos Preview, bir üniversitenin barındırdığı bilimsel analiz aracı hata verince sunucudaki bir betiği kullanarak dosyaları kopyaladı, koddaki enjeksiyon açığını buldu ve hesaplamayı bu yolla çalıştırdı.

İkinci grup, gönderilmemesi gereken formların gönderilmesi. Sahte ihbar dışında, yayımlanmamış bir araştırma modeli bir devlet formunun deneme kopyası yüklenmeyince gerçek formun bulunduğu siteye gidip formu orada gönderdi. Claude Haiku 4.5 de son aşamada durması istenen bir formu, ek bir onay sayfası olacağını düşünerek birkaç kez gönderdi.

Üçüncü grupta Claude, token veya ücretle korunan verilere kısıtlamaları aşarak ulaştı. Claude Mythos 5, bir fotoğrafın konumunu bulmaya çalışırken bir yerel yönetimin mülk haritasının ayar dosyasından çalışan erişim token’ları buldu ve sunucuya doğrudan istek gönderdi. Başka bir örnekte bir eyalet kurumunun ücretli verisini, panonun her ziyaretçiye verdiği token’ı kullanarak ücret ödemeden sorguladı. Dördüncü grupta ise Claude Opus 5 ve Claude Mythos 5 gibi modeller, getirme aracındaki URL uzunluğu sınırını ücretsiz URL kısaltma servisleriyle aştı; da.gd servisinin işletmecisi de bu kullanımı Anthropic’e bildirdi.

Anthropic, vakaların bir kısmının ABD’de federal, eyalet ve yerel düzeydeki kamu kurumlarına ait sitelerde yaşandığını, Beyaz Saray’ı bilgilendirdiğini ve ilgili her kurumu haberdar ettiğini söylüyor. Şirket, kurumların isteği üzerine ve sistemlerindeki açıkları ifşa etmemek için kurumların adını vermedi.

Alınan önlemler

Şirket, bazı herkese açık değerlendirmeleri artık çalıştırmadığını, bazılarını çevrimdışı sürümlere taşıdığını, web fetch gibi internet erişim araçlarının sınırlarını sıkılaştırdığını ve bu tür davranışları otomatik tespit edip engelleyen bir araç geliştirdiğini açıkladı. Anthropic’e göre bu araç rapordaki tüm vakalara karşı test edildiğinde hepsini engelledi. Güvenlik ve izleme önlemlerinin bu davranışları güvenilir şekilde yakaladığı doğrulanana kadar tüm iç değerlendirmelerde canlı internet erişimi kapatılıyor.

Anthropic bu vakaları, Temmuz ve Eylül’de raporladığı siber güvenlik olaylarından daha az ciddi görüyor ve çoğunu, görevi verildiği gibi tamamlayamayan modelin durmak yerine kısıtlamayı aşmaya çalıştığı “ısrar” davranışı olarak tanımlıyor. Şirket, tam bir hizalama değerlendirmesi yapılmadığını ve sahte ihbar vakasındaki dürüstlük boyutuna dair görüşünün ileri analizle değişebileceğini de not ediyor.

Kaynak: Anthropic: Investigating unintended model actions in our evaluations and internal use · TechCrunch · 6abc Philadelphia (Philadelphia Polis Departmanı açıklaması)

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları