Local LLM Dil Çevirisi Benchmark'ı

RAM'e taştırıp da adam gibi çalıştırmanın bir yolu yok mu? 64 GB RAM çöpe gitti gibime geliyor vallahi.
cache-type-k = q4_0
cache-type-v = q4_0 bu yöntem kullanılabilir, ön bellekten kısılır, 4 bite indirgenir. mmproj vision CPU'ya devredilebilir. no-mmproj-offload
 
Teşekkür ederim hocam.



Peki hangisini indirmemi önerirsiniz? XXS olan mı yoksa S olan mı?
 
Hangi yerel LLM çalıştırıcıları kullanıyorsunuz?
 
Ben 2. 5080'i almayı planlıyordum güyya Kara Cuma'da falan ama bu fiyatlarla suya düştü.
Ben de ikinci bir kart almayı düşünüyorum. 3090 kadar fazla VRAM olmaz ama 32 GB VRAM ile de yapılır bence bir şeyler. Ayrıca ikinci kartla DLSS 5 bile FPS kaybı olmadan çalıştırılabilir bence.
 
İngilizce'den Türkçe'ye nasıl peki?
 
Şu işlemi yapın:

cache-type-k / cache-type-v llama.cpp bayrakları. Ollama'da karşılığı ortam değişkeni. Ollama K ve V'yi ayrı ayrı açmıyor, tek bir OLLAMA_KV_CACHE_TYPE değişkeni ikisini birden belirliyor, yani istediğin q4_0 + q4_0 tam olarak bu. Flash attention da aynı anda OLLAMA_FLASH_ATTENTION=1 ile açılıyor.

Windows'ta kalıcı yapmak için CMD veya PowerShell'de:


setx OLLAMA_FLASH_ATTENTION 1
setx OLLAMA_KV_CACHE_TYPE q4_0
GUI'den istersen "Sistem ortam değişkenlerini düzenle" → Ortam Değişkenleri → Yeni yolunu da kullanabilirsin. Sonra Ollama'yı tepsi (tray) simgesinden kapatıp yeniden başlat. setx yalnızca yeni açılan süreçlere uygulanır, o yüzden açık kalan Ollama eski değeri kullanır. Ollama'yı terminalden ollama serve ile çalıştırıyorsan terminali de yeniden aç. Doğrulamak için %LOCALAPPDATA%\Ollama\server.log başındaki config satırında OLLAMA_KV_CACHE_TYPE:q4_0 görünmeli.

İngilizce'den Türkçe'ye nasıl peki?

Ben kurs videoları için kullanıyorum bayağı başarılı.
 
Bu siteyi kullanmak için çerezler gereklidir. Siteyi kullanmaya devam etmek için çerezleri kabul etmelisiniz. Daha Fazlasını Öğren.…