Google, ses kayıtlarını metne dönüştürmek için geliştirdiği yeni yapay zekâ modeli Gemini 3.5 Transcribe’ı tanıttı. Şirket, modelin 85’ten fazla dili desteklediğini ve konuşmaları önceki çözümlere kıyasla daha hassas şekilde metne dönüştürdüğünü belirtiyor.
Gemini 3.5 Transcribe, Konuşmaları Daha Doğal Şekilde Metne Dönüştürüyor
Gemini 3.5 Transcribe, kullanıcıların konuşma sırasında yaptığı düzeltmeleri anlayarak bunları metne doğru şekilde yansıtabiliyor. Model, “ııı”, “eee” gibi dolgu kelimelerini otomatik olarak kaldırırken konuşmanın anlamını ve konuşmacının doğal anlatım biçimini koruyor. Ayrıca gürültülü ortamlardaki sesler de doğru şekilde algılanabiliyor.
Model, birden fazla kişinin bulunduğu konuşmalarda da kullanılabiliyor. Gemini 3.5 Transcribe, aynı ses kaydında üç farklı konuşmacıyı zaman damgalarıyla birlikte ayırt edebiliyor. Ek olarak 85’ten fazla dilin yanı sıra farklı bölgesel aksan ve lehçeler de destekleniyor.
Google, Gemini 3.5 Transcribe’ın macOS’teki Gemini uygulamasında sesli komutlarla farklı işlemler gerçekleştirmek için kullanılabileceğini belirtiyor. Kullanıcılar yalnızca seslerini kullanarak Gemini’dan görsel oluşturmasını, bilgi aramasını, metinleri özetlemesini veya dosyaları analiz etmesini isteyebilecek.
Gemini 3.5 Transcribe, Android cihazlardaki kullanıcıların konuşarak düşüncelerini daha düzenli ve kullanıma hazır metinlere dönüştürmesine yardımcı olan Rambler dikte özelliğinin temelini de oluşturuyor. Rambler, konuşmalardaki dolgu kelimelerini otomatik olarak temizleyebiliyor ve sesli komutlarla metin üzerinde düzenleme yapılmasına olanak tanıyor. Öte yandan geliştiriciler, modeli Google AI Studio ve Google Antigravity üzerinden kullanarak kendi uygulamalarına entegre etmeye başlayabilecek.
Kaynak: Google