CANLI
xAI, Imagine API’yi 2.0’a Yükseltmeye Hazırlanıyor: Görüntü ve Video Tek…·Microsoft MAI-Cyber-1-Flash’ı Duyurdu·Moonshot AI, Kimi K3 Model Ağırlıklarını ve Teknik Raporunu Açık…
2 Oct 2026 · 22:29 GMT+3
Ai Haber – Türkiyenin Yapay Zeka Haber Portalı
MODEL HABERLERI SAYI #2.752 2 Eki 2026 · Cuma

Microsoft AI, MAI-Transcribe-2-Streaming ve MAI-Voice-2.1 ses modellerini duyurdu

Microsoft AI, 1 Ekim 2026’da akışlı konuşma-metin modeli MAI-Transcribe-2-Streaming ile birlikte MAI-Voice-2.1 ve hızlı varyant MAI-Voice-2.1-Flash’i duyurdu.

AiHaber Editör
Editör
2DK 4OKUMA

★ Hızlı Özet

  • Microsoft AI, 1 Ekim 2026’da akışlı konuşma-metin modeli MAI-Transcribe-2-Streaming ile birlikte MAI-Voice-2.1 ve hızlı varyant MAI-Voice-2.1-Flash’i duyurdu.
  • Akışlı transkripsiyon MAI-Transcribe-2-Streaming, 60 dilde düşük gecikmeli gerçek zamanlı transkript üretiyor ve otomatik sürekli dil tespit…
  • MAI-Voice-2.1 ve Flash MAI-Voice-2.1, 23 dil / 26 yerel ayar destekleyen çok dilli metinden-konuşmaya modeli; aynı konuşmacı sesinin diller …
  • Erişim Modeller Microsoft Foundry, MAI Playground, Vercel ve (yakında) LiveKit ile Azure Voice Live üzerinden; ses modelleri ayrıca OpenRout…

Microsoft AI, 1 Ekim 2026’da akışlı konuşma-metin modeli MAI-Transcribe-2-Streaming ile birlikte MAI-Voice-2.1 ve hızlı varyant MAI-Voice-2.1-Flash’i duyurdu. Laboratuvar, Transcribe modelinin Artificial Analysis doğruluk sıralamasında hem nihai hem kısmi transkriptlerde birinciliği aldığını belirtiyor.

Akışlı transkripsiyon

MAI-Transcribe-2-Streaming, 60 dilde düşük gecikmeli gerçek zamanlı transkript üretiyor ve otomatik sürekli dil tespiti destekliyor. Konuşma bitmesini beklemek yerine, ses alındıktan yaklaşık 100 milisaniye sonra ilk kısmi hipotezleri (“partials”) üretiyor; bağlam geldikçe bunları güncelleyip kararlı metne kilitliyor. İç değerlendirmelerde canlı alt yazı/dikte senaryolarında kelimelerin ekrana rakip ürüne göre 2 kat daha hızlı çıktığı belirtiliyor. Yıl sonuna kadar tanıtım fiyatı saatlik ses başına 0,54 dolar.

MAI-Voice-2.1 ve Flash

MAI-Voice-2.1, 23 dil / 26 yerel ayar destekleyen çok dilli metinden-konuşmaya modeli; aynı konuşmacı sesinin diller arasında yerel aksanla kalabildiği vurgulanıyor. Fiyat 1 milyon karakter başına 22 dolar. Flash varyantı aynı dil kapsamını sunuyor; 45 saniyelik sesi uçtan uca yaklaşık 150 ms gecikmeyle üretebildiği, çıkarımın yüzde 55 daha hızlı ve fiyatın yaklaşık yüzde 60 daha ucuz olduğu, karakter başına 15 dolar olduğu belirtiliyor. Her iki ses modeli birkaç saniyelik referans sesle klonlamayı ve kötüye kullanımı sınırlayan onay korumalarını destekliyor.

Erişim

Modeller Microsoft Foundry, MAI Playground, Vercel ve (yakında) LiveKit ile Azure Voice Live üzerinden; ses modelleri ayrıca OpenRouter üzerinden sunuluyor. Laboratuvar, canlı ajan demosu için Playground’da Chatter adlı bir örnek de açtı.

Kaynak: Microsoft AI — Our first streaming transcription model

— Paylaş

Beğendiysen yay.

Yapay Zeka Sohbetlerinde
Sosyal Medyada

Tartışma

Bu habere emoji ile tepki ver

Hizli:

Henüz yorum yok. İlk yorumu siz yapın!

Yapıcı ve saygılı yorumlar bekliyoruz. Topluluk kuralları