Yapay Zeka

Meta’dan Muse Voice Transcribe: 20’den Fazla Konuşmacıyı Gerçek Zamanlı Ayırt Edebiliyor

Meta, yapay zeka destekli ses teknolojileri alanındaki yeni modeli Muse Voice Transcribe’ı duyurdu. Meta Superintelligence Labs tarafından geliştirilen sistem; konuşmayı gerçek zamanlı olarak metne dönüştürmenin yanında 20’den fazla konuşmacıyı birbirinden ayırabiliyor, konuşmanın ne zaman sona erdiğini algılayabiliyor ve aynı cümle içerisinde gerçekleşen dil değişikliklerini takip edebiliyor.

Meta’nın ilk gerçek zamanlı ses algılama modeli olarak tanımladığı Muse Voice Transcribe, klasik bir konuşmadan metne dönüştürme aracından daha kapsamlı çalışıyor. Sistem; streaming ASR, konuşmacı ayrıştırma ve konuşma sonu algılama işlemlerini tek model içerisinde gerçekleştiriyor.

Muse Voice Transcribe 20’den fazla konuşmacıyı ayırt edebiliyor

Muse Voice Transcribe’ın en dikkat çekici özelliklerinden biri, kalabalık toplantılar ve uzun süreli görüşmeler için geliştirilmiş olması.

Meta’nın paylaştığı bilgilere göre model, bir saati aşan ses kayıtlarını işleyebiliyor ve aynı görüşmede 20’den fazla farklı konuşmacıyı takip edebiliyor. Üstelik bunun için kayıt tamamlandıktan sonra ayrı bir konuşmacı ayrıştırma işleminin uygulanmasına gerek duyulmuyor.

Bu özellik, yapay zeka ve ses işleme alanında speaker diarization olarak biliniyor. Sistem konuşmanın farklı bölümlerini analiz ederek hangi bölümün hangi konuşmacıya ait olduğunu belirliyor.

Bu sayede Muse Voice Transcribe;

  • toplantı kayıtlarının yazıya dökülmesi,
  • çevrim içi görüşmeler,
  • röportajlar,
  • çağrı merkezi kayıtları,
  • konferanslar,
  • gerçek zamanlı altyazı sistemleri

gibi birçok alanda kullanılabilecek bir altyapı sunuyor.

70’ten fazla dil kullanılarak eğitildi

Meta, Muse Voice Transcribe’ın eğitiminde 70’ten fazla dilin kullanıldığını açıklıyor. Bunların 25’ten fazlası modelin ilk sürümü için kapsamlı biçimde doğrulanmış durumda.

Modelin önemli özelliklerinden biri de code-switching, yani konuşma sırasında diller arasında geçiş yapılmasını algılayabilmesi.

Örneğin bir kullanıcı konuşmasına Türkçe başlayıp cümlenin ortasında İngilizce bir kelime veya ifadeye geçtiğinde sistemin bunu tek bir konuşmanın parçası olarak algılaması amaçlanıyor.

Bu özellik özellikle birden fazla dili günlük yaşamında birlikte kullanan kişiler açısından önemli olabilir. Geleneksel konuşma tanıma sistemleri bazı durumlarda konuşmanın hangi dilde olduğunu önceden belirlemek zorunda kalırken Muse Voice Transcribe, dil değişikliklerini konuşma akışı içerisinde takip edebiliyor.

Meta ayrıca dil, anahtar kelime ve bağlam yönlendirmelerinin modele aktarılabildiğini belirtiyor. Böylece kişi isimleri, şirket adları, teknik terimler veya özel kelimelerin daha doğru şekilde algılanması mümkün hale gelebiliyor.

Sesi 80 milisaniyelik parçalar halinde analiz ediyor

Muse Voice Transcribe’ın gerçek zamanlı çalışabilmesini sağlayan temel teknolojilerden biri sesin çok küçük bölümlere ayrılması.

Meta’nın teknik açıklamasına göre model, sesi 80 milisaniyelik parçalar halinde işliyor.

Model her yeni ses parçasını aldığında iki temel seçenek arasında karar veriyor:

Daha fazla ses dinlemek veya duyduğu içeriği metne dönüştürmek.

Bu yöntem sayesinde kolaylıkla anlaşılabilen kelimeler hızlı şekilde yazıya dönüştürülürken belirsiz kelimelerde sistem biraz daha fazla ses bağlamı bekleyebiliyor.

Meta bu yaklaşımı “adaptive delay”, yani uyarlanabilir gecikme olarak adlandırıyor.

Amaç, gerçek zamanlı konuşma sistemlerinin en önemli sorunlarından biri olan hız ve doğruluk arasındaki dengeyi kelime bazında optimize etmek.

Kullanıcının konuşmayı ne zaman bitirdiğini anlayabiliyor

Muse Voice Transcribe yalnızca söylenen kelimeleri algılamakla sınırlı değil.

Model aynı zamanda konuşmanın başlangıç ve bitiş noktalarını belirleyebilen bir endpointing sistemine sahip.

Bu özellik özellikle sesli yapay zeka asistanları açısından önem taşıyor.

Bir kullanıcının kısa süre düşünmek için duraklaması ile konuşmasını tamamen bitirmesi aynı şey değil. Sesli asistanın erken yanıt vermesi konuşmanın bölünmesine, fazla beklemesi ise kullanıcı deneyiminin yavaşlamasına neden olabiliyor.

Muse Voice Transcribe, konuşmanın ne zaman gerçekten tamamlandığını tahmin ederek yapay zeka sistemlerinin daha doğal zamanda yanıt üretmesine yardımcı olmayı hedefliyor.

Meta, gerçek zamanlı konuşmadan metne dönüştürmede zirvede olduğunu söylüyor

Meta’nın açıklamasına göre Muse Voice Transcribe, 1 Eylül 2026 itibarıyla Artificial Analysis tarafından hazırlanan gerçek zamanlı konuşmadan metne dönüştürme değerlendirmesinde ilk sırada bulunuyor.

Şirket ayrıca modelin halka açık konuşmacı ayrıştırma testlerinde de güçlü sonuçlar elde ettiğini belirtiyor.

Ancak yapay zeka modellerinin benchmark sıralamalarının yeni modeller ve güncellemelerle hızlı şekilde değişebildiğini hatırlatmak gerekiyor. Dolayısıyla bu sıralama Meta’nın duyurusunu yaptığı 1 Eylül 2026 tarihindeki durumu yansıtıyor.

Muse Voice Transcribe nerelerde kullanılabilecek?

Meta yeni ses modelini kendi ürünlerinde de kullanmaya başladı.

Muse Voice Transcribe şu anda Meta AI’ın Mac uygulamasındaki sesli dikte özelliklerinde ve şirketin kodlama aracı Muse Code içerisinde kullanılabiliyor.

Geliştiriciler ise modele Meta Model API üzerinden erişebiliyor.

Yeni modelin özellikle gelecekte yapay zeka asistanları açısından önemli hale gelmesi beklenebilir. Gerçek zamanlı konuşmayı anlayabilen, konuşmacıları ayırabilen ve dil değişikliklerini takip edebilen modeller;

akıllı gözlükler, sesli asistanlar, toplantı uygulamaları, otomatik altyazı sistemleri ve yapay zeka destekli çağrı merkezleri gibi alanlarda kullanılabilir.

Meta’nın WhatsApp, Instagram ve Messenger gibi milyarlarca kullanıcısı bulunan platformlara Muse Voice Transcribe teknolojisini getirip getirmeyeceği ise şirket tarafından henüz açıklanmış değil.

Google ve Meta arasında sesli yapay zeka rekabeti büyüyor

Meta’nın duyurusu, Google’ın yeni nesil konuşmadan metne dönüştürme modeli Gemini 3.5 Transcribe’ı tanıtmasından yalnızca birkaç gün sonra geldi.

Google, Gemini 3.5 Transcribe’ı 26 Ağustos 2026 tarihinde duyurdu. Model gerçek zamanlı ses akışlarını düşük gecikmeyle yazıya dönüştürebiliyor ve önceden kaydedilmiş seslerde konuşmacı bilgisi ile kelime seviyesinde zaman damgaları oluşturabiliyor.

Google ayrıca teknolojiyi Gemini API, Google AI Studio ve şirketin farklı ürünlerindeki sesli kullanım senaryolarıyla birleştiriyor.

Meta’nın Muse Voice Transcribe ile özellikle çok konuşmacılı görüşmeler, uzun kayıtlar ve konuşma içerisindeki dil geçişleri üzerine yoğunlaşması, sesli yapay zeka alanındaki rekabetin önümüzdeki dönemde daha da hızlanacağını gösteriyor.

Yapay zeka şirketleri için artık yalnızca kullanıcının ne söylediğini anlamak yeterli değil. Yeni nesil sistemlerin kimin konuştuğunu, konuşmanın hangi dilde olduğunu ve kullanıcının konuşmayı gerçekten bitirip bitirmediğini de gerçek zamanlı olarak anlayabilmesi gerekiyor.

Muse Voice Transcribe, Meta’nın bu hedef doğrultusunda geliştirdiği en kapsamlı ses modellerinden biri olarak öne çıkıyor.

İlgili Haberler

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Başa dön tuşu