Qwen ekibi, gerçek zamanlı simültane çeviri modelinin yeni sürümünü duyurdu: Qwen3.8-LiveTranslate. Resmi blog yazısına göre hedef yalnızca hızlı çeviri değil; net duyma, doğru aktarma ve konuşmanın arkasındaki kişiyi/bağlamı da taşımak. Ortalama gecikme (LAAL) bir önceki nesildeki 2,8 saniyeden 2,3 saniyeye indiriliyor.
Üç yeni yetenek
Qwen, 60 dil desteğinin üzerine üç senaryo odaklı özellik eklediğini yazıyor: gerçek zamanlı konuşmacı ayrımı (her cümlenin kime ait olduğu ve daha kararlı ses klonlama), kaynak ve çevirinin aynı iki dilli ekranda senkron çıktısı, ve uzun bağlamla belirsizlik giderme (önceki turları kullanarak özel isim ve terimleri daha tutarlı çevirme).
Mimari: Interleave ve Thinker–Talker
Bu nesil, simültane çeviriyi tek bir ses–metin iç içe (interleaved) akış olarak yeniden kurguluyor; duyulan ses ve üretilen çeviri önbelleğe alınarak yeniden kullanılabiliyor. Model, Hybrid-MoE tabanlı Thinker–Talker iki modüllü tasarım kullanıyor: Thinker video, ses, kaynak metin ve çeviriyi zamansal sırayla tek nedensel dizide birleştiriyor; Talker ise çeviriyi kaynak sesle birleştirerek orijinal konuşmacının tınısını koruyan konuşma sentezliyor.
Ölçümler ve erişim
Qwen’e göre Omnilingua-MSpeaker (14 dil yönü, çok konuşmacılı uzun ses) üzerinde sadakat, akıcılık, özlülük ve Diarization Error Rate (DER) boyutlarında günümüzün ana akım gerçek zamanlı çeviri sistemlerini geçiyor. FLEURS ses test setinde 70 dil yönünde çeviri kalitesi, ortalama gecikme, ASR ve TTS kalitesinde de önceki nesil ve rakip sistemlere göre önde olduğu belirtiliyor. Giriş sesi ve çıkış metni 60 dil; çıkış sesi 29 dil. Model DashScope üzerinden qwen3.8-livetranslate-flash-realtime WebSocket API ile kullanılabiliyor; blogda mikrofon akışı ve geri oynatma için örnek istemci kodu paylaşılıyor.
Kaynak: Qwen – Qwen3.8-LiveTranslate: Names the speaker. Carries the meaning.
Henüz yorum yok. İlk yorumu siz yapın!