Google, Gemini 3.8 Flash TTS ve 3.8 Flash-Lite TTS Modellerini Tanıttı

Google, daha doğal ve ifade gücü yüksek sesler oluşturabilen Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS modellerini duyurdu. Yeni modeller, metinleri yalnızca sabit seslerle okumak yerine karakter tasarımından konuşma biçimine kadar çok daha ayrıntılı şekilde yönlendirilebiliyor.

Gemini 3.8 Flash TTS ile Özel Sesler Oluşturulabiliyor

Gemini 3.8 Flash TTS modeli, özellikle karakter sesleri ve yaratıcı içerikler için geliştirildi. Doğal dil komutlarıyla sıfırdan yeni bir ses oluşturulabiliyor ve sesin rolü, aksanı ve karakteristik özellikleri belirlenebiliyor. Sistem 100’den fazla dil ve lehçeyi destekliyor. Google, ayrıca 2.000’den fazla hazır ses içeren geniş bir ses kütüphanesi sunuyor. Kullanıcılar bu sesleri farklı içeriklerde kullanabilirken, oluşturdukları özel sesleri kaydedip sonraki projelerde tutarlı şekilde kullanabiliyor.

Bir diğer dikkat çeken özellik ise ses kopyalama desteği. Sistem, 30 saniyelik bir ses örneğinden kullanıcının veya kullanım hakkına sahip olduğu bir kişinin ses profilini oluşturabiliyor. Google, bu özelliğin kullanılabilmesi için ses sahibinin sözlü onayını zorunlu tutuyor. Oluşturulan seslerde ayrıca SynthID filigranı ve C2PA kimlik bilgileri kullanılıyor.

Gemini 3.8 Flash TTS ve 3.8 Flash-Lite TTS, oluşturulan sesin yalnızca ne söylediğini değil, nasıl söylediğini de ayrıntılı şekilde kontrol etmeye imkân tanıyor. Senaryolara sahne yönergeleri eklenerek konuşmanın tonu, hızı, aksanı ve ifade biçimi belirlenebiliyor. Modeller aynı zamanda iki konuşmacılı sahneleri tek bir senaryo üzerinden oluşturabiliyor. Böylece podcast, sesli kitap ve dramatik içeriklerde iki farklı ses doğal şekilde sırayla konuşabiliyor. Gülme, iç çekme ve nefes alma gibi sözlü olmayan tepkiler ile “mhm” ve “yeah” gibi dinleme tepkileri de senaryoya eklenebiliyor.

Gemini 3.8 Flash-Lite TTS Modeli Yüksek Hacimli İçeriklere Odaklanıyor

Google, Gemini 3.8 Flash-Lite TTS modelini ise daha çok yüksek hacimli ve maliyet odaklı ses üretimi için konumlandırıyor. Model; dublaj, sesli içerik üretimi ve yapay zekâ destekli sesli asistanlar gibi çok sayıda ses çıktısının gerektiği kullanım alanlarına odaklanıyor.

Her iki model de Hume AI tarafından gerçekleştirilen değerlendirmelerde üst sıralarda yer alıyor. Google’ın paylaştığı sonuçlara göre Gemini 3.8 Flash TTS, Voice Design Benchmark’ta 71.4 puanla birinci olurken aksan modelleme testinde de 60.8 puanla lider konumda bulunuyor. Modeller, ek olarak Hume AI’ın Overall Quality Index değerlendirmesinde birinci ve ikinci sırada. Şirket, Voice Arena’daki görme engelli kişi değerlendirmelerinde de modellerin Japonca, Brezilya Portekizcesi, Vietnamca, Modern Standart Arapça, Meksika İspanyolcası ve Hintçe gibi farklı dillerde üst sıralarda yer aldığını vurguluyor.

Gemini 3.8 Flash TTS ve 3.8 Flash-Lite TTS modelleri, Gemini API ve Google AI Studio üzerinden denenebiliyor. Gemini 3.8 Flash TTS, ayrıca Gemini Notebook’ta, 3.8 Flash-Lite TTS ise Google Vids’te herkes için kullanıma sunuluyor. Kurumsal kullanıcılar için Gemini Enterprise desteğinin ise ilerleyen dönemde API üzerinden sunulması planlanıyor. Son olarak Google; Agora, LiveKit, Pipecat ve Vercel gibi platformların yeni TTS modellerini kendi yapay zekâ tabanlı ses çözümlerine entegre ettiğini belirtiyor.

Kaynak: blog.google

Exit mobile version