
Google, yapay zeka destekli ses teknolojisinde önemli bir adım attı. Şirket, Gemini 3.5 Transcribe aracını API üzerinden erişime açarak, geliştiricilerin ve işletmelerin 85+ dilde akıllı ses çözümlemesi yapmasına olanak tanıdı.
Gemini 3.5 Transcribe Nedir?
Gemini 3.5 Transcribe, Google’ın yeni nesil ses-kelime çeviri sistemidir. Geleneksel ses tanıma araçlarından farklı olarak, bu araç yalnızca kelimesi kelimesine aktarım yapmaz; konuşmacının asıl niyetini anlayarak metne dönüştürür.
Sistem şu özellikleri sunuyor: Yanlış başlangıçları düzeltme, doldurucu kelimeleri ayıklama, sayı ve tarih biçimlendirme, özel kelime desteği ve konuşmacı tanımlama.
İki Farklı API Uç Noktası
Google, farklı kullanım senaryoları için iki ayrı uç noktası sunuyor. gemini-3.5-transcribe bir saate kadar kayıtlı ses dosyalarını işleyebiliyor. gemini-3.5-transcribeLive ise gerçek zamanlı WebSocket akışı ile alt saniye gecikme süresinde canlı transkripsiyon imkanı sunuyor.
İşletmeler İçin Ne İfade Ediyor?
Google Gemini 3.5 Transcribe’ın piyasaya çıkması, ses tabanlı yapay zeka hizmetleri sunan birçok girişimi doğrudan etkileyecek. Podcast düzenleme, toplantı notu çıkarma, müşteri hizmetleri otomasyonu ve sağlık sektöründe ses kayıtlarının metne dönüştürülmesi gibi alanlarda yeni bir rekabet dönemi başlayacak.
Türk geliştiriciler için de önemli fırsatlar doğdu. Google’ın bu API’si, yerel dil desteği ve akıllı biçimlendirme özellikleriyle çok dilli içerik üreten platformlar için güçlü bir altyapı sunuyor.
Fiyatlandırma ve Erişim
Gemini 3.5 Transcribe şu an API üzerinden aktif olarak erişime açık. Standart transkripsiyon için dakika başına fiyatlandırma uygulanıyor. Akıllı mod, standart moddan farklı olarak içerik analizi de yaptığından, kullanım senaryosuna göre maliyet değişkenlik gösterebiliyor.
Google’ın bu hamlesi, sesli yapay zeka pazarındaki rekabeti kızıştırırken, girişimciler ve kurumsal yazılım geliştiricileri için maliyet avantajı sağlayacak yeni nesil ses çözümlerinin önünü açıyor.
Henüz yorum yok. İlk yorumu siz yapın!