OpenAI, gerçekçi ruh sağlığı konuşmalarında AI yanıtlarını ölçmek için MentalHealthBench’i açık olarak duyurdu. Kıyas, 22 ülkeden 80’den fazla lisanslı psikolog ve psikiyatristle (19 dil, yaklaşık 20 alt uzmanlık) birlikte geliştirildi. Yazı, ChatGPT’nin terapi veya profesyonel bakımın yerine geçmediğini açıkça belirtiyor.
Kapsam
Önceki değerlendirmelerin çoğunun acil senaryolara ve geniş ön tanımlı kriterlere odaklandığı; spektrumun tamamında uzman rehberliğiyle uyumu ölçme boşluğu olduğu savunuluyor. Privacy-preserving tekniklerle sentetik konuşmalar üretilmiş; yetişkin, 13–17 yaş genç, bakıcı ve klinisyen personası; akut olmayan, yüksek akutluk ve acil durum spektrumu kapsanıyor. Konuşmaların ChatGPT’deki konu sıklığını temsil etmediği not ediliyor.
Yöntem ve sonuçlar
HealthBench çalışmalarının üzerine kurulmuş. Uzmanlar her sentetik konuşmayı okuyup son kullanıcı mesajına yanıt için −10 ile +10 ağırlıklı rubrik maddeleri yazmış; her konuşma en az üç uzman tarafından incelenmiş, en az iki uzmanın anlaştığı ve üçüncünün çelişmediği maddeler tutulmuş. Otomatik notlandırıcı olarak GPT-5.6 Sol kullanılıyor. On davranış boyutuna ayrıştırılabilir skorlar ve frontier modellerin grafikleri paylaşılıyor; makale ayrıntılı ayarları içeriyor. Ayrıca 44 kullanıcıyla uzman–kullanıcı tercih karşılaştırması yapılmış (yalnızca akut olmayan konuşmalar). Kıyas açık bırakılarak araştırmacıların yöntemleri incelemesi teşvik ediliyor.
Henüz yorum yok. İlk yorumu siz yapın!