CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
16 Sep 2026 · 01:26 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
ÇIN TEKNOLOJISI SAYI #2.613 16 Eyl 2026 · Çarşamba

StepFun StepAudio 3: beş ses modeli Artificial Analysis’te zirvede

阶跃星辰 (StepFun), StepAudio 3 serisini duyurdu: Realtime, ASR, TTS, Gen ve Music.

AiHaber Editör
Editör
2DK 2OKUMA

★ Hızlı Özet

  • 阶跃星辰 (StepFun), StepAudio 3 serisini duyurdu: Realtime, ASR, TTS, Gen ve Music.
  • StepAudio 3 Realtime Native full-duplex gerçek zamanlı konuşma sunuyor. Artificial Analysis Conversational Dynamics'te yüzde 98,9 ile birinc…
  • ASR, TTS, Gen ve Music ASR, Çinçe/İngilizce, diyalekt, karışık dil, uzun ses ve alan terimlerinde bağlamlı tanıma hedefliyor; Artificial Ana…
  • TTS, gerçek zamanlı akışlı üretimle gülme, tereddüt, kekeleme gibi paralanguage unsurlarını da içeren «insan benzeri» konuşma sentezi sunuyo…

(StepFun), StepAudio 3 serisini duyurdu: Realtime, ASR, TTS, Gen ve Music. Beş model de StepFun açık platformuna alındı. Şirketin aktarımına göre birden fazla model Artificial Analysis sıralamalarında birinci konumda.

StepAudio 3 Realtime

Native full-duplex gerçek zamanlı konuşma sunuyor. Artificial Analysis Conversational Dynamics’te yüzde 98,9 ile birinci; Speech Reasoning’de yüzde 99,7 ile birinci olduğu belirtiliyor. Semantik, ton, duygu, paralanguage ve ortam sesini birlikte yorumlayabildiği; Think-While-Speaking ile muhakemeyi konuşmayla paralel yürütebildiği; Tool Call ve uzun görevlerin oturumu bloke etmeden asenkron çalıştığı aktarılıyor.

ASR, TTS, Gen ve Music

ASR, Çinçe/İngilizce, diyalekt, karışık dil, uzun ses ve alan terimlerinde bağlamlı tanıma hedefliyor; Artificial Analysis non-streaming ASR’da WER yüzde 1,7 ile birinci sırayı paylaştığı yazılıyor.

TTS, gerçek zamanlı akışlı üretimle gülme, tereddüt, kekeleme gibi paralanguage unsurlarını da içeren «insan benzeri» konuşma sentezi sunuyor.

Gen, insan sesi, efekt, ortam ve müziği tek çerçevede üretebiliyor; çok karakterli diyalog ve zamanlama kontrolü vurgulanıyor.

Music, sıfırdan şarkı, a cappella eşlik, cover ve ABC notasyonlu çok turlu etkileşimli bestelemeyi destekliyor.

Kaynak: IT – StepAudio 3 · Platform: platform.stepfun.com

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları