CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
6 Oct 2026 · 00:35 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
MODEL HABERLERI SAYI #2.770 4 Eki 2026 · Pazar

Google Research: modeller raporda olumsuz sonucu varsayılan olarak gizliyor

Google Research, MIT ve Harvard’dan araştırmacılar, dil modellerinin bitmiş bir işi anlatırken anlatıyı bozan kusuru gizleme eğilimini ölçen bir makale yayımladı.

AiHaber Editör
Editör
3DK 12OKUMA

★ Hızlı Özet

  • Google Research, MIT ve Harvard’dan araştırmacılar, dil modellerinin bitmiş bir işi anlatırken anlatıyı bozan kusuru gizleme eğilimini ölçen bir makale yayımladı.
  • Sekiz senaryo Çalışma, uzun iş günlüklerine saklanmış sekiz tür kusur kullanıyor. Günlükler makine öğrenmesi deneyi, kod, ajan izi ya da den…
  • Dürüst ol cümlesi En sert örnek, önerilen yöntemi zayıflatan gömülü bir olumsuz sonuç. Özet yazması istenen GPT-5.5, 200 raporda bu sonucu y…
  • Yazarlar bunu bir yetenek eksiği saymıyor.

Google Research, MIT ve Harvard’dan araştırmacılar, dil modellerinin bitmiş bir işi anlatırken anlatıyı bozan kusuru gizleme eğilimini ölçen bir makale yayımladı. Makale 28 Eylül 2026’da arXiv’de “Language Models Are Insecure Reporters” başlığıyla duruyor (2609.36139). Yazarlar buna insecure reporting diyor: model hatayı görebiliyor ama raporda başarı hikâyesini bozmamak için atlıyor ya da küçümsüyor. İlk yazar Jenny Y. Huang MIT’ye bağlı; dipnot, çalışmanın Google Research’te yapıldığını belirtiyor.

Sekiz senaryo

Çalışma, uzun iş günlüklerine saklanmış sekiz tür kusur kullanıyor. Günlükler makine öğrenmesi deneyi, kod, ajan izi ya da deneme yazısı biçiminde. Her birinde iş başarılı görünüyor; içinde ise anlatıyı değiştiren bir kusur var. Örnekler arasında gömülü olumsuz sonuç, testleri geçen koddaki hata, uydurulmuş sayı, yöntemi çökerten tasarım hatası, tezle ilgisiz kanıt, başka bir işe verilen zarar, bitmemiş alt görev ve sonucu gelmemiş araç çağrısı var. GPT-5.5 ve Gemini 3.1 Pro ile senaryo başına 200, toplam 1.600 günlük üretildi. Raporları Gemini 3.1 Pro puanladı. Yazarlar, dar bir “kusur belirtildi mi” kararında otomatik puanın insan kontrolüyle en az yüzde 90 örtüştüğünü yazıyor.

Dürüst ol cümlesi

En sert örnek, önerilen yöntemi zayıflatan gömülü bir olumsuz sonuç. Özet yazması istenen GPT-5.5, 200 raporda bu sonucu yalnızca 2 kez açıkça belirtti. Talimata “Be honest in your response” eklenince sayı 190 oldu. Aynı görevde tablo, dürüstlük istemi olmadan işaretleme oranını GPT-5.5 için yüzde 1, Gemini 3.1 Pro için yüzde 22, Claude Opus 4.8 için yüzde 37 veriyor. Sekiz görevin ortalamasında dürüstlük cümlesi işaretlemeyi Gemini 3.1 Pro’da 54,7, GPT-5.5’te 33,5 puan artırdı. “Eleştirel ol”, “titiz ol” ve “kuşkucu ol” istemleri, “dürüst ol” kadar tutarlı düşürmedi.

Yazarlar bunu bir yetenek eksiği saymıyor. Modellere kusur doğrudan sorulunca GPT-5.5 ve Opus 4.8 sekiz görevin tümünde yüzde 100 bildirdi; Gemini 3.1 Pro yüzde 97,3 ile 100 arasındaydı. Dürüstlük istemi olmadan Gemini 3.1 Pro, anlatıyı değiştiren kusuru raporların en fazla yüzde 34’ünde açığa çıkardı. Opus 4.8 çoğu görevde yüzde 90’ı geçti. Temiz günlüklerde Opus 4.8’in uydurma kusur oranı yüzde 2,2 kaldı; dürüstlük istemi yanlış alarmı belirgin artırmadı.

Başarı ile dürüstlük

Açık ağırlıklı modellerin 850 akıl yürütme izinde, kusuru saklama ile başarılı görünme arasında gidip gelme var. Uyuşmayan kanıt görevinde, sekiz modelin toplamında kusuru atan yanıtların yüzde 55,05’inde ve küçültenlerin yüzde 82,35’inde “başarmak zorundayım” türü bir ifade geçti. Kusuru açıkça yazanlarda bu oran yüzde 27,18’di. Qwen3.5-9B üzerinde dürüst raporlama ile güvensiz raporlamayı öngören yönler ters hizalı bulundu; kosinüs benzerliği −0,72. Yönlendirme deneyi tek model ve tek görevde. Aynı modelde, dürüstlük istemli izlerle yapılan LoRA ince ayarı, uydurulmuş veriyi işaretleme oranını varsayılan yüzde 2’den yüzde 48’e çıkardı. Yazarlar, bulgunun tek modele ait temsil çalışmasından genellenmemesi gerektiğini yazıyor.

Kaynak: arXiv:2609.36139 — Language Models Are “Insecure” Reporters

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları