CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
11 Aug 2026 · 20:39 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
ARAşTıRMA · DOğAL DIL İşLEME arXiv:2608.09930 10 Ağu 2026 · v1

Doğallığın Ötesinde: Otomatik Metin-Konuşma Değerlendiricilerini Dilbilimsel Temelli Boyutlar Üzerinde İncelemek

Oluwanifemi Bamgbose, Simon Rosen, Jash Shah, Lindsay Devon Brin, Hoang H Nguyen, +4 yazar

YAYIN:10 Ağu 2026 ALAN:cs.SD OKUMA:2

Özet

Otomatik Metin-Konuşma (TTS) değerlendirme yöntemlerinin (Ortalama Görüş Puanı (MOS) yordayıcıları ve Ses Büyük Dil Modelleri (Audio-LLM) yargıçları) insan algısını yansıtması beklenir, ancak bunların dinleyicilerin gerçekte algıladığı konuşmanın farklı yönlerini ne kadar iyi yakaladıkları belirsizdir. "Doğallığı", 10 farklı algısal boyuta yayılan dilbilimsel temelli bir açıklama şemasına dönüştürüyoruz ve bunu, eğitimli dilbilimci değerlendiriciler tarafından açıklamalı 860 ifadeden oluşan, TTS için ilk boyut düzeyinde meta değerlendirme kriterini oluşturmak için kullanıyoruz. Dört MOS öngörücüsü ve dört Audio-LLM yargıcının kıyaslamasından elde edilen sonuçlar, MOS öngörücülerinin akustik sinyal kalitesi üzerinde çöktüğünü ortaya koyarken, Audio-LLM yargıçları tüm boyutlarda genellemeyen seçici, istem-bağımlı algılama göstermektedir. Her iki sınıf da dilsel olarak yapılandırılmış konuşma hatalarının geniş bir kapsamını güvenilir bir şekilde yakalayamaz. Veri kümemiz, açıklama şemamız ve değerlendirme kodumuz, daha hedefe yönelik ve yorumlanabilir TTS değerlendirmesini desteklemek için herkese açık olarak yayınlandı.

Özetle: Otomatik Metin-Konuşma (TTS) değerlendirme yöntemlerinin (Ortalama Görüş Puanı (MOS) yordayıcıları ve Ses Büyük Dil Modelleri (Audio-LLM) yargıçları) insan algısını yansıtması beklenir, ancak bunların dinleyicilerin ger…

Özet

Otomatik Metin-Konuşma (TTS) değerlendirme yöntemlerinin (Ortalama Görüş Puanı (MOS) yordayıcıları ve Ses Büyük Dil Modelleri (Audio-LLM) yargıçları) insan algısını yansıtması beklenir, ancak bunların dinleyicilerin gerçekte algıladığı konuşmanın farklı yönlerini ne kadar iyi yakaladıkları belirsizdir. "Doğallığı", 10 farklı algısal boyuta yayılan dilbilimsel temelli bir açıklama şemasına dönüştürüyoruz ve bunu, eğitimli dilbilimci değerlendiriciler tarafından açıklamalı 860 ifadeden oluşan, TTS için ilk boyut düzeyinde meta değerlendirme kriterini oluşturmak için kullanıyoruz. Dört MOS öngörücüsü ve dört Audio-LLM yargıcının kıyaslamasından elde edilen sonuçlar, MOS öngörücülerinin akustik sinyal kalitesi üzerinde çöktüğünü ortaya koyarken, Audio-LLM yargıçları tüm boyutlarda genellemeyen seçici, istem-bağımlı algılama göstermektedir. Her iki sınıf da dilsel olarak yapılandırılmış konuşma hatalarının geniş bir kapsamını güvenilir bir şekilde yakalayamaz. Veri kümemiz, açıklama şemamız ve değerlendirme kodumuz, daha hedefe yönelik ve yorumlanabilir TTS değerlendirmesini desteklemek için herkese açık olarak yayınlandı.

Orijinal Özet (İngilizce)

Automated Text-to-Speech (TTS) evaluation methods (Mean Opinion Score (MOS) predictors and Audio Large Language Models (Audio-LLM) judges) are expected to reflect human perception, yet it is unclear how well they capture the distinct aspects of speech that listeners actually perceive. We deconstruct "naturalness" into a linguistically grounded annotation schema spanning 10 distinct perceptual dimensions, and use it to construct the first dimension-level meta-evaluation benchmark for TTS, comprising 860 utterances annotated by trained linguist raters. Results from benchmarking four MOS predictors and four Audio-LLM judges reveal that MOS predictors collapse onto acoustic signal quality, while Audio-LLM judges show selective, prompt-dependent detection that does not generalise across all dimensions. Neither class reliably captures a breadth of linguistically structured speech errors. Our dataset, annotation schema, and evaluation code are publicly released to support more targeted and interpretable TTS evaluation.

Kaynak: arXiv:2608.09930 · PDF

BibTeX

@article{bamgbose2026beyond,
  title   = {Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions},
  author  = {Oluwanifemi Bamgbose and Simon Rosen and Jash Shah and Lindsay Devon Brin and Hoang H Nguyen and Anke Koelzer and Rachel Hansen and Tara Bogavelli and Fanny Riols},
  journal = {arXiv preprint arXiv:2608.09930},
  year    = {2026},
  url     = {https://arxiv.org/abs/2608.09930}
}

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları