İkisi de önemli, CUDA+VRAM istiyor bunlar. Eğitim esnasında CUDA düşük diye zaman maliyeti yükselir ama iş bitince VRAM'den hızlı hızlı çalışır.

RAM'e ne kadar çok taşarsa o kadar çok az tokenle iş yapıyor. En vahim kısmı burada eğittin mesela iyi hoş 12 GB'den taşması var bir de 16 GB'den taşması var.

Yanıt alma süresi bu işte önemli.

5080 16 GB VRAM qwen 3.6 27b 4bıt'e yetmiyor %75 kadarı GPU'da %25 kadarı RAM'e taşıyor, bir soru soruyorum ortalama yanıt süresi 2 dakika. Bunu 5070'e koysan bir soru 4 dakika bekle babam bekle. 2 dakika en azından tolere edilebilir ağır soru soruyorsun diye, iyice düşünüyor thinking modunda vs görüyorsun İngilizce ne düşündüğünü de, güzel yapmışlar vesselam.

Kısacası 5060 Ti 16 GB daha iyi gözüküyor. Modelin sığması ve zaman maliyeti arasında tercih yapmam gerekiyor mecburen sallıyorum 5 dk bekleyeceğim response time için fakat en azından model sığacak çalıştırabileceğim darboğaz yapmayacak. Doğru mu anladım hocam?
 
Kısacası 5060 Ti 16 GB daha iyi gözüküyor. Modelin sığması ve zaman maliyeti arasında tercih yapmam gerekiyor mecburen sallıyorum 5 dk bekleyeceğim response time için fakat en azından model sığacak çalıştırabileceğim darboğaz yapmayacak. Doğru mu anladım hocam?

Modeli sığdırmak mesele. Düz DDR5 ile GDDR7 arasındaki bant genişliği farkı Ferrari F80-Şahin 4 vites kıvamında. Oyun PC'lerinde gen3 bile kullanılıyor RTX5000 için, bu işte PCI-e slotu da BIOS'tan 5.0 ayarlanmalı, bant genişliği hayati.