Aynı modeli öneririm. Ancak ROCm aktif etmeniz lazım, yoksa düşük token verir. Isla sıkıştırması 3 bit olsa dahi 4 bite yakınsar, başarıdadır; bu yüzden daha iyi performans gösterir. Model + context + mtp + mmproj ile birlikte rahat sığar.
cache-type-k = q4_0
cache-type-v = q4_0 önbelleği yaparsanız daha iyi sonuç alırsınız ve model daha rahat sığar.
Ben de ikinci bir kart almayı düşünüyorum. 3090 kadar fazla VRAM olmaz ama 32 GB VRAM ile de yapılır bence bir şeyler. Ayrıca ikinci kartla DLSS 5 bile FPS kaybı olmadan çalıştırılabilir bence.
cache-type-k / cache-type-v llama.cpp bayrakları. Ollama'da karşılığı ortam değişkeni. Ollama K ve V'yi ayrı ayrı açmıyor, tek bir OLLAMA_KV_CACHE_TYPE değişkeni ikisini birden belirliyor, yani istediğin q4_0 + q4_0 tam olarak bu. Flash attention da aynı anda OLLAMA_FLASH_ATTENTION=1 ile açılıyor.
Windows'ta kalıcı yapmak için CMD veya PowerShell'de:
setx OLLAMA_FLASH_ATTENTION 1
setx OLLAMA_KV_CACHE_TYPE q4_0
GUI'den istersen "Sistem ortam değişkenlerini düzenle" → Ortam Değişkenleri → Yeni yolunu da kullanabilirsin. Sonra Ollama'yı tepsi (tray) simgesinden kapatıp yeniden başlat. setx yalnızca yeni açılan süreçlere uygulanır, o yüzden açık kalan Ollama eski değeri kullanır. Ollama'yı terminalden ollama serve ile çalıştırıyorsan terminali de yeniden aç. Doğrulamak için %LOCALAPPDATA%\Ollama\server.log başındaki config satırında OLLAMA_KV_CACHE_TYPE:q4_0 görünmeli.