IBM BenchDrift: Yapay Zeka Modelleri Aynı Soruya Farklı Söyleyişle Farklı Yanıt Veriyor
IBM araştırmacıları, mevcut yapay zeka kıyaslama (benchmark) sistemlerinin güvenilirliğini sorgulayan yeni bir çerçeve olan BenchDrift‘i tanıttı. Yapılan araştırmaya göre, bir model yanıtı bilse bile aynı soruyu farklı şekilde sorulduğunda başarısız olabiliyor.
AI analisti Rohan Paul (@rohanpaul_ai), IBM’in bu yeni çerçevesini paylaştı. BenchDrift, aynı soruları yanıt değiştirmeden sistematik olarak yeniden ifade ediyor ve bir model’s score’un yalnızca ifade biçiminden ne kadar etkilendiğini ölçüyor.
IBM BenchDrift Nasıl Çalışıyor?
BenchDrift, mevcut kıyaslamalar için bir denetim çerçevesi (auditing framework) görevi görüyor:
- Sistematik Yeniden İfade: Aynı sorular farklı kelimeler ve cümle yapılarıyla yeniden yazılıyor
- Doğruluk Farkı Ölçümü: Aynı modelin farklı ifadelerdeki performans farkı hesaplanıyor
- Kıyaslama Analizi: Sonuçlar, mevcut benchmark sistemlerinin güvenilirliğiyle karşılaştırılıyor
Çarpıcı Sonuçlar: Yüzde 74.7 Performans Farkı
8 farklı model ve 3 kıyaslama üzerinde yapılan testlerde, en iyi durum ile en kötü durum doğruluğu arasındaki fark ortalaması yüzde 74.7 puan olarak ölçüldü. Araştırmacılar için en şaşırtıcı bulgu: Daha güçlü modellerin aslında daha savunmasız olmasıydı.
Temel bulgu şu: Temel doğruluk oranı yüzde 60’ın üzerindeki her model-kıyaslama çifti için, soruların yeniden ifade edilmesi düzelttiği doğru yanıttan daha fazla doğru yanıtı bozdu.
AI Modelleri Kıyaslanırken Nelere Dikkat Etmeli?
BenchDrift araştırması, yapay zeka benchmark sistemlerinin güvenilirliği konusunda ciddi sorular gündeme getiriyor. Bir modelin performansı, kullandığı soru kalıbına bağlı olarak dramatik şekilde değişebiliyor.
Bu bulgular, özellikle yapay zeka model karşılaştırmalarında metodoloji seçiminin ne kadar kritik olduğunu ortaya koyuyor. IBM’in bu çerçevesi, AI araştırma camiasında benchmark güvenilirliği tartışmalarını yeniden alevlendirecek gibi görünüyor.
Henüz yorum yok. İlk yorumu siz yapın!