Microsoft AI, 1 Ekim 2026’da akışlı konuşma-metin modeli MAI-Transcribe-2-Streaming ile birlikte MAI-Voice-2.1 ve hızlı varyant MAI-Voice-2.1-Flash’i duyurdu. Laboratuvar, Transcribe modelinin Artificial Analysis doğruluk sıralamasında hem nihai hem kısmi transkriptlerde birinciliği aldığını belirtiyor.
Akışlı transkripsiyon
MAI-Transcribe-2-Streaming, 60 dilde düşük gecikmeli gerçek zamanlı transkript üretiyor ve otomatik sürekli dil tespiti destekliyor. Konuşma bitmesini beklemek yerine, ses alındıktan yaklaşık 100 milisaniye sonra ilk kısmi hipotezleri (“partials”) üretiyor; bağlam geldikçe bunları güncelleyip kararlı metne kilitliyor. İç değerlendirmelerde canlı alt yazı/dikte senaryolarında kelimelerin ekrana rakip ürüne göre 2 kat daha hızlı çıktığı belirtiliyor. Yıl sonuna kadar tanıtım fiyatı saatlik ses başına 0,54 dolar.
MAI-Voice-2.1 ve Flash
MAI-Voice-2.1, 23 dil / 26 yerel ayar destekleyen çok dilli metinden-konuşmaya modeli; aynı konuşmacı sesinin diller arasında yerel aksanla kalabildiği vurgulanıyor. Fiyat 1 milyon karakter başına 22 dolar. Flash varyantı aynı dil kapsamını sunuyor; 45 saniyelik sesi uçtan uca yaklaşık 150 ms gecikmeyle üretebildiği, çıkarımın yüzde 55 daha hızlı ve fiyatın yaklaşık yüzde 60 daha ucuz olduğu, karakter başına 15 dolar olduğu belirtiliyor. Her iki ses modeli birkaç saniyelik referans sesle klonlamayı ve kötüye kullanımı sınırlayan onay korumalarını destekliyor.
Erişim
Modeller Microsoft Foundry, MAI Playground, Vercel ve (yakında) LiveKit ile Azure Voice Live üzerinden; ses modelleri ayrıca OpenRouter üzerinden sunuluyor. Laboratuvar, canlı ajan demosu için Playground’da Chatter adlı bir örnek de açtı.
Kaynak: Microsoft AI — Our first streaming transcription model
Henüz yorum yok. İlk yorumu siz yapın!