Yapay Zeka
Trend

Gemini artık sesinizi kopyalayıp senaryoyu oyuncu gibi seslendirebiliyor

Google, yapay zeka destekli ses üretiminde önemli bir güncellemeye imza attı. Yeni Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS modelleri; yalnızca yazılı metni sese dönüştürmekle kalmıyor, kullanıcıların seslerini kopyalayabiliyor, sıfırdan yeni ses karakterleri oluşturabiliyor ve bir senaryoyu vurgu, duygu, tempo ve aksan gibi ayrıntıları dikkate alarak seslendirebiliyor.

Google’ın açıklamasına göre yeni nesil Gemini ses modelleri, yapay zeka ile oluşturulan seslerin daha doğal ve yönetilebilir hale gelmesini hedefliyor. Özellikle Gemini 3.8 Flash TTS; oyunlardan sesli kitaplara, podcast’lerden dublaj çalışmalarına kadar profesyonel içerik üretimine yönelik gelişmiş kontrol seçenekleri sunuyor.

Gemini 3.8 Flash TTS yalnızca metin okumuyor, performans sergiliyor

Geleneksel metinden sese araçlarında kullanıcı genellikle bir ses seçiyor ve metni sisteme okutuyor. Google’ın yeni yaklaşımında ise seslendirme biçimi çok daha ayrıntılı şekilde yönlendirilebiliyor.

Gemini 3.8 Flash TTS, doğal dil komutları kullanılarak tamamen yeni bir ses karakteri oluşturulmasına izin veriyor. Kullanıcılar oluşturulacak sesin karakterini, aksanını, konuşma biçimini ve genel tonunu tarif edebiliyor.

Model ayrıca senaryodaki satırlara ayrı ayrı talimat verilmesini destekliyor. Böylece belirli bir cümlenin daha yavaş okunması, başka bir bölümün fısıldanması veya bir karakterin heyecanlı, üzgün ya da sakin konuşması istenebiliyor.

Google’ın verdiği bilgilere göre sistem; kahkaha, iç çekme, nefes alma ve kısa duraklamalar gibi konuşmaya doğallık kazandıran ses olaylarını da işleyebiliyor.

2.000’den fazla hazır ses seçeneği geliyor

Google, Gemini 3.8 Flash TTS ile birlikte 2.000’den fazla üretime hazır ses seçeneğine erişilebildiğini belirtiyor.

Bu sesler yalnızca farklı konuşmacılardan oluşmuyor. Meksika İspanyolcası, Quebec Fransızcası ve İskoç İngilizcesi gibi bölgesel konuşma biçimleri de ses kütüphanesinde yer alıyor.

Bunun yanında kullanıcılar doğal dil komutlarıyla tamamen yeni ses profilleri oluşturabiliyor. Google’ın açıklamasına göre Gemini 3.8 Flash TTS, 100’den fazla dil ve lehçede özel ses tasarımına yönelik özellikler sunuyor.

Gemini yalnızca 30 saniyelik kayıtla sesinizi kopyalayabiliyor

Yeni sistemin en dikkat çekici özelliklerinden biri ise ses kopyalama, yani voice replication özelliği.

Gemini API belgelerine göre kullanıcılar, bir kişinin konuşma özelliklerini kısa bir referans kaydından yeniden oluşturabiliyor.

Google’ın teknik gereksinimlerinde referans ses kaydının yaklaşık 10 ila 30 saniye uzunluğunda olması öneriliyor. Bunun yanında ses sahibinin ayrıca özel bir izin cümlesini seslendirmesi gerekiyor.

Bu sayede oluşturulan yapay ses, aynı kişinin ses karakterini daha uzun içeriklerde tekrar kullanabiliyor.

Özellik özellikle içerik üreticileri, seslendirme sanatçıları veya markalar açısından dikkat çekici olabilir. Örneğin bir içerik üreticisi kendi ses profilini oluşturarak farklı videolarda benzer bir anlatıcı sesinin kullanılmasını sağlayabilir.

Ancak Google, başka bir kişinin sesinin izinsiz biçimde kopyalanmasını engellemek amacıyla ses sahibinin doğrulanmış onayını zorunlu tutuyor.

Türkçe onay desteği de bulunuyor

Google’ın resmi Gemini API belgelerinde ses kopyalama işlemi için kullanılabilen onay cümleleri arasında Türkçe de bulunuyor.

Türkçe için tr-TR yerel ayarı destekleniyor ve kullanıcıdan sesin sahibi olduğunu ve Google’ın bu sesi sentetik bir ses modeli oluşturmak için kullanmasına izin verdiğini doğrulayan belirli bir cümleyi okuması isteniyor.

Burada önemli bir ayrıntı bulunuyor. Google’ın güncel geliştirici belgelerinde Gemini 3.8 Flash TTS için 130, Flash-Lite TTS için ise 101 desteklenen dil belirtilmesine rağmen, yayımlanan genel dil listesinde Türkçe şu anda ayrıca yer almıyor. Buna karşılık ses kopyalamaya ilişkin onay sistemi Türkçeyi resmi olarak destekliyor. Dolayısıyla Türkçe ses üretiminin kapsamı ve kalite seviyesi konusunda Google’ın genel TTS destek tablosunun netleşmesini beklemek daha doğru olacaktır.

İki kişi aynı senaryoda konuşturulabiliyor

Gemini 3.8 TTS modellerinin bir diğer önemli özelliği ise iki konuşmacılı sahneleri tek bir senaryodan oluşturabilmesi.

Sistem, farklı karakterlere ayrı sesler atayabiliyor ve konuşma sırasını koruyarak iki kişi arasında doğal bir diyalog oluşturabiliyor.

Google ayrıca uzun süreli ses üretiminde karakterlerin ses özelliklerinin korunmasına önem verildiğini belirtiyor. Böylece özellikle podcast, sesli kitap ve uzun video anlatımları gibi saatler sürebilecek içeriklerde sesin zaman içinde değişmesinin azaltılması hedefleniyor.

Bu özellik yapay zeka ile oluşturulan podcast’lerde veya oyunlardaki karakter diyaloglarında önemli ölçüde üretim kolaylığı sağlayabilir.

Gemini 3.8 Flash ve Flash-Lite arasındaki fark ne?

Google iki modeli farklı kullanım senaryoları için konumlandırıyor.

Gemini 3.8 Flash TTS, mümkün olan en yüksek ses kalitesine, oyunculuk nüanslarına, aksanlara ve karmaşık diyaloglara odaklanıyor.

Gemini 3.8 Flash-Lite TTS ise daha düşük gecikmeli ve uygun maliyetli, yüksek hacimli üretim için tasarlanmış durumda. Bu model özellikle toplu seslendirme, otomatik dublaj sistemleri, sesli asistanlar ve büyük ölçekte içerik üretimi gibi alanları hedefliyor.

İki model aynı API yapısını kullandığı için geliştiriciler ihtiyaçlarına göre modeller arasında daha kolay geçiş yapabiliyor.

Yapay zeka seslerine SynthID koruması ekleniyor

Ses klonlama teknolojilerinin gelişmesi beraberinde deepfake ve dolandırıcılık risklerini de getiriyor.

Google bu nedenle Gemini Audio modelleriyle oluşturulan seslere SynthID dijital filigranı eklediğini belirtiyor.

Bu filigran insan kulağının fark edemeyeceği şekilde ses dosyasına yerleştiriliyor ve içeriğin yapay zeka tarafından üretilip üretilmediğinin daha sonra tespit edilebilmesini amaçlıyor.

Ses kopyalama özelliğinde ayrıca ses sahibinin izin kaydıyla doğrulanması gerekiyor. Google, oluşturulan ses profillerinde C2PA kimlik bilgileri gibi ek şeffaflık mekanizmalarının da kullanıldığını belirtiyor.

Gemini 3.8 TTS nerelerde kullanılabilecek?

Google’ın açıklamasına göre yeni modeller kademeli olarak şirketin farklı servislerine dağıtılıyor.

Gemini 3.8 Flash TTS, geliştiriciler için Gemini API ve Google AI Studio üzerinden kullanılabiliyor. Son kullanıcı tarafında ise Gemini Notebook içerisinde kullanıma sunuluyor.

Gemini 3.8 Flash-Lite TTS de Gemini API ve Google AI Studio üzerinden geliştiricilere açılırken, son kullanıcı tarafında Google Vids içerisinde kullanıma sunuluyor. Google, Flash-Lite TTS’nin Google Vids içerisinde 100’den fazla dilde doğal seslendirme üretmek için kullanılacağını belirtiyor.

Ses kopyalama özelliğinin Google AI Studio üzerinden kullanımı ise bazı bölgelerde sınırlandırılmış durumda. Google’ın resmi açıklamasına göre bu özellik Avrupa Ekonomik Alanı, Birleşik Krallık, İsviçre, Hindistan ile ABD’deki Illinois ve Texas eyaletlerinde Google AI Studio üzerinden kullanılamıyor.

Yeni modellerle birlikte Google’ın metinden sese teknolojisi klasik bir “metni okutma” aracından ziyade yapay zeka destekli bir dijital seslendirme stüdyosuna dönüşmeye başlıyor. Özellikle ses kopyalama, çoklu konuşmacı desteği ve satır bazında oyunculuk talimatları; podcast, oyun, dublaj, reklam ve video üretimi gibi alanlarda yapay zeka kullanımını önemli ölçüde genişletebilir.

İlgili Haberler

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Başa dön tuşu