Meta, ilk gerçek zamanlı ses algılama modeli Muse Voice Transcribe'ı kullanıma sundu. Meta Superintelligence Labs tarafından geliştirilen model; konuşmayı metne dönüştürme, farklı konuşmacıları ayırt etme ve bir kişinin konuşmasını ne zaman tamamladığını belirleme görevlerini tek bir sistem içinde gerçek zamanlı olarak gerçekleştiriyor.Uzun ve kalabalık konuşmaları işleyebiliyorMuse Voice Transcribe'ın öne çıkan özelliklerinden biri, uzun ve kalabalık konuşmaları işleyebilmesi. Model, bir saati aşan ses kayıtlarını ve 20'den fazla konuşmacının yer aldığı görüşmeleri ek bir işlem aşamasına ihtiyaç duymadan metne dönüştürebiliyor. Konuşmacı günlüğü oluşturma olarak da bilinen "speaker diarization" özelliği sayesinde sistem, konuşmanın hangi bölümünün kim tarafından söylendiğini belirleyerek metni konuşmacılara göre ayırıyor.Model 70'ten fazla dil kullanılarak eğitildi. Meta, bunlardan 25'inin ilk sürüm öncesinde kapsamlı biçimde doğrulandığını belirtiyor. Muse Voice Transcribe, farklı dillerin aynı konuşma veya cümle içinde kullanıldığı durumları da algılayabiliyor. Böylece iki dilli kişilerin günlük konuşmalarında sıkça görülen, cümlenin ortasında başka bir dile geçme alışkanlığı metne doğrudan yansıtılabiliyor. Dil, anahtar kelime ve bağlam bilgileri kullanılarak özel isimler ya da belirli terimlerin daha doğru tanınması da sağlanabiliyor. Konuşmaları 80 milisaniyelik bölümler halinde işliyorMuse Voice Transcribe, konuşmaları 80 milisaniyelik bölümler halinde işliyor. Sistem her bölümde biraz daha dinlemeye devam etmek veya duyduğu içeriği metne aktarmak arasında karar veriyor. Meta'nın "uyarlanabilir gecikme" adını verdiği bu yaklaşım, kolay anlaşılan kelimelerin hızlı biçimde yazıya geçirilmesini; daha zor kelimelerde ise modelin ek ses bağlamını beklemesini sağlıyor. Böylece hız ile doğruluk arasındaki dengenin her kelime için ayrı ayrı kurulması hedefleniyor.Modelin konuşmanın başlangıç ve bitiş noktalarını kendi başına belirleyebilmesi, sesli komutlarla çalışan uygulamalar açısından da önem taşıyor. Sistem, kullanıcının durakladığı anlarla konuşmasını tamamen bitirdiği anları ayırt ederek yanıtın ne zaman üretilmesi gerektiğine karar verebiliyor. Meta’ya göre Muse Voice Transcribe, 1 Eylül itibarıyla Artificial Analysis'in gerçek zamanlı konuşmadan metne dönüştürme sıralamasında ilk sırada yer alıyor. Muse Voice Transcribe, Meta AI'ın masaüstü uygulamasındaki sistem genelinde dikte özelliğinin yanı sıra şirketin kodlama aracı Muse Code'da kullanılmaya başlandı. Geliştiriciler modele Meta Model API üzerinden de erişebiliyor. API'ın fiyatı bin dakikalık ses kaydı için 3 dolar, başka bir ifadeyle saat başına yaklaşık 18 sent olarak açıklandı. Meta'nın yeni modeli, Google'ın benzer gerçek zamanlı konuşma özellikleri sunan Gemini 3.5 Transcribe'ı tanıtmasından kısa süre sonra geldi. Google söz konusu teknolojiyi Android ve ilerleyen dönemde Chrome'a taşımayı planlarken Meta'nın Muse Voice Transcribe'ı WhatsApp, Instagram veya Messenger gibi geniş kullanıcı kitlesine sahip hizmetlerine entegre edip etmeyeceği henüz bilinmiyor.