@TÜRK GAMBİTİ, çıkarım aşamasında GGUF modeller çalışıyor tabii ama uzun cevaplar vermesini isteyince aniden yarıda kesiyor (hikaye anlat dediğimde hikaye aniden kesiliyor mesajla birlikte). Context Length değerinden dolayı olabilir.
Diğer optimizasyonlara hiç girmedim, özellikle KV Cache vb. Ek olarak model fine tuning etmek istediğim zamanlar da oldu ama Q4-Q5 hali 7~ GB olan modellerin safetensors halleri 8 GB VRAM'e sığmıyor.
Epeydir uzağım bu işlere, yeni şeyler çıktıysa bilmiyorum.