Tavus, insanlarla gerçek zamanlı iletişim kurabilen Griffin yapay zekâ modelini tanıttı. Şirket, Griffin’in canlı görüşmelerde insanların yüzde 48’i tarafından gerçek bir insan sanıldığını ve modelin video tabanlı Turing testini geçen ilk yapay zekâ olduğunu öne sürüyor.
Griffin, Video Turing Testinden Geçmesiyle Dikkat Çekiyor
Tavus’a göre daha önceki yapay zekâ sistemlerinde video Turing testini geçme oranı yüzde 3’ün altında kalırken, Griffin ile gerçekleştirilen canlı görüşmelerde katılımcıların yüzde 48’i karşılarındaki sistemin gerçek bir insan olduğunu düşündü. Model, ayrıca NVIDIA’nın çift yönlü yapay zekâ video karşılaştırmasında ilk sırada yer aldı. Şirket, Griffin’i “İnsan Etkileşim Modeli” (Human Interaction Model – HIM) olarak tanımlıyor. Modelin amacı yalnızca konuşulanları yanıtlamak değil, insanlarla iletişim sırasında görme, dinleme, konuşma ve tepki verme süreçlerini aynı anda gerçekleştirmek.
Griffin’in öne çıkan özelliklerinden biri, insanlarla konuşurken karşı tarafın sözünü tamamen bitirmesini beklememesi. Model, karşısındaki kişiyi dinlerken aynı anda görüntüyü analiz edebiliyor, konuşabiliyor ve uygun yüz ifadeleri ile jestler oluşturabiliyor. Tavus’un paylaştığı örneklerde yapay zekâ, “Simon Says” oyununu oynarken konuşmaları dinleyip oyuncuların ellerini takip ediyor ve kendi hareketlerini buna göre gerçekleştiriyor. Şirket, modelin yalnızca bir yüz görüntüsü üretmek yerine tüm video karesini oluşturduğunu belirtiyor.
Bir başka örnekte ise konuşma sırasında kameraya bir tavus kuşu gösteriliyor. Görülen nesne konuşmanın akışına dahil edilerek anlatılan hikâye buna göre değiştirilebiliyor. Böylece modelin görsel algısı, ürettiği yanıtın içeriğini doğrudan etkileyebiliyor. Görsel algı yalnızca nesneleri tanımakla sınırlı değil. Tavus’un gösterdiği örneklerden birinde model, Rubik küpünü çözmeye çalışan bir kullanıcıyı ellerindeki hareketleri takip ederek yönlendiriyor. Kullanıcı düşünmek için konuşmayı bıraktığında ise Griffin bekleyebiliyor.
Bir diğer senaryoda model, lehimleme işlemi yapan bir kullanıcıya yardımcı olurken gözlerin ve ellerin hareketlerini takip ediyor, belirli bir işlemin ne kadar sürdüğünü de hesaplıyor. Tavus, bunun yapay zekânın yalnızca sözcüklere değil, zaman ve görsel bağlama da tepki verebilmesini sağladığını belirtiyor. Ayrıca konuşmanın duygusal tonu; ses, yüz ifadeleri ve jestlerle birlikte yansıtılabiliyor. Bu bağlamda terfi alan bir kullanıcıyla konuşan modelin tepkisinin, ses kapalı olsa bile yüz ifadesi ve hareketlerinden anlaşılabildiği gösteriliyor.
Öte yandan Tavus, Griffin’in insanlarla etkileşimde gerçek bir kişiden ayırt edilmesinin güvenlik açısından yeni sorunları beraberinde getirdiğini vurguluyor. Son olarak şirket, modelin kamuya sunulmadan önce ek güvenlik çalışmalarından geçirilmesi gerektiğini ifade ediyor.
Kaynak: Tavus
