Google, Gemini 3.8 Live ve 3.8 Live Extended Thinking Modellerini Tanıttı

Google, gerçek zamanlı sesli etkileşim yeteneklerini geliştiren Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modellerini duyurdu. Yeni modeller, kullanıcılarla daha akıcı konuşmalar gerçekleştirmek ve ses üzerinden karmaşık görevleri yerine getirmek için geliştirildi.

Gemini 3.8 Live, Daha Akıcı Sesli Konuşmalar Sunuyor

Google’a göre Gemini 3.8 Live, ölçeklenebilirlik ve maliyet verimliliğine odaklanırken konuşma zekâsını akıcı diyalog ve görsel bağlamlandırma özellikleriyle bir araya getiriyor. Model, görsel girdileri neredeyse gerçek zamanlı olarak işleyerek konuşmalara ek bağlam sağlayabiliyor.

https://storage.googleapis.com/gweb-uniblog-publish-prod/original_videos/gemini-audio__demo__chess-player.mp4#t=0.001

Gemini 3.8 Live, Artificial Analysis tarafından gerçekleştirilen Speech Agent Arena değerlendirmesinde ikinci sırada yer alıyor. Ayrıca 97 dil destekleniyor ve konuşma sırasında diller arasında otomatik olarak geçiş yapılabiliyor. Gemini 3.8 Live, kullanıcıyla konuşmaya devam ederken arka planda araçları ve API çağrılarını da çalıştırabiliyor. Böylece model, uzun süren bir görev tamamlanırken kullanıcıya bilgi vermeyi ve sohbeti sürdürmeyi mümkün kılıyor.

Gemini 3.8 Live Extended Thinking, Karmaşık Görevlere Odaklanıyor

Gemini 3.8 Live Extended Thinking ise daha karmaşık görevler için geliştirilen ve daha gelişmiş çok adımlı akıl yürütme yetenekleri sunan model olarak öne çıkıyor. Akıl yürütme sürecini konuşmayı kesmeden gerçekleştirebilen Extended Thinking modeli, kullanıcı bir görev verdiğinde “Kontrol edeyim…” gibi sözlü tepkilerle isteği aldığını doğal şekilde belli edebiliyor. Daha sonra arka planda çok adımlı işlemleri yürütürken ilerleme hakkında sesli bilgi verebiliyor.

https://storage.googleapis.com/gweb-uniblog-publish-prod/original_videos/WebCompanion_ExtendedThinking_Blog_V1_dDEN3nP.mp4#t=0.001

Google’ın aktardığı verilere göre Gemini 3.8 Live Extended Thinking, Artificial Analysis Speech to Speech Quality Index’te 82.6 puanla genel sıralamada ilk sırada yer alıyor. Model, ek olarak τ-Voice testinde yüzde 68.6, Sierra’nın τ-Voice-banking testinde ise yüzde 35.1 görev tamamlama oranına ulaşıyor. Big Bench Audio testindeki skor ise yüzde 97.7 olarak açıklanıyor.

Geliştiriciler için Gemini Live API Desteği

Yeni modeller yalnızca Google’ın kendi hizmetlerinde kullanılmayacak. Gemini Live API, geliştiricilerin gerçek zamanlı sesli yapay zekâ uygulamaları oluşturmasına olanak tanıyor. Agora, Fishjam, LiveKit, Pipecat, Vercel ve Vision Agents gibi platformlar da Gemini Live API desteğiyle ses tabanlı arayüzler geliştirebiliyor.

Diğer bir yandan Google; Salesforce, Genspark ve Lumeris gibi şirketlerle iş birliği yaptığını ve bu şirketlerin Gemini 3.8 Live modellerinin düşük gecikme, akıcı konuşma ve araç kullanımı yeteneklerinden yararlanacağını açıkladı.

Yeni modellerin kullanım alanları Gemini API ve Google AI Studio’nun yanı sıra Google’ın çeşitli ürünlerine de genişletiliyor. Gemini 3.8 Live, Search Live’da kullanıma sunulurken Extended Thinking modeli Gemini Live’a geliyor. Kurumsal tarafta ise modeller Gemini Enterprise kapsamında özel ön izleme sürecine giriyor.

Son olarak Google, yapay zekâ tarafından oluşturulan seslerin tamamında SynthID filigranlama teknolojisini kullanmaya devam ediyor. Görünmez filigran doğrudan ses çıktısına işlenerek yapay zekâ tarafından oluşturulan içeriklerin tespit edilmesine yardımcı oluyor.

Kaynak: Google

Exit mobile version