Eki Görüntüle 274751

En hafif varyantinda bile 16 GB VRAM ve 32 GB RAM'li bir sistemde "partial GPU offload" gosteriyor, sizin bilgisayarda dusunemiyorum. Model calisir muhtemelen calismasina ancak saniye basi token degeriniz cok dusuk olacaktir muhtemelen.

Uncensored model olmasi (her seye tamam abi ceken bir model) bozmayacaksa HauhauCS abimizin Uncensored Qwen 3.6-27B-A3B modeli var, onun Q2 K P varyanti guzel, dusunebilirsiniz. Tabii bu model de VRAM'e sigmayacagi icin RAM'e vuracaktir, yapabilecek bir şey yok.

Tamamen 8 GB VRAM'e sigabilecek bir Qwen modeli oldugunu sanmiyorum.

Yeni yeni local modellerle ilgileniyorum da bu Uncensored derken tam olarak ne oluyor, farkı nedir tam olarak?
Şu an qwen3.8:27b kullanıyorum güzel cevap veriyor gibi , lakin uzun kullanma şansım olmadı.
Dediğiniz versiyonu kurmalı mıyım?
 
Anladığım kadarıyla Qwen 3.8 27B çalıştırabileceğim maksimum seviye. LM Studio üzerinden Qwen 3.8 ve GitHub üzerinden Comfy UI yükleyeceğim gibi duruyor.



Sistem benim değil, kuzenimin. NVIDIA kartı olduğundan onun sistemi üzerinde denemek istedim.

Qwen 3.8 27b'de 5070'le ortalama 7-8 dakikada cevap alan gordum ben. Sizdeki kartla mumkun degil. Local LLM calistirmak cok ciddi donanim isteyen bir sey.

Yeni yeni local modellerle ilgileniyorum da bu Uncensored derken tam olarak ne oluyor, farkı nedir tam olarak?
Şu an qwen3.8:27b kullanıyorum güzel cevap veriyor gibi , lakin uzun kullanma şansım olmadı.
Dediğiniz versiyonu kurmalı mıyım?

Uncensored'de etik degerlere takilmiyor nasil meth yapabilecegini bile anlatiyor.
 
Qwen 3.8 27b'de 5070'le ortalama 7-8 dakikada cevap alan gordum ben. Sizdeki kartla mumkun degil. Local LLM calistirmak cok ciddi donanim isteyen bir sey.



Uncensored'de etik degerlere takilmiyor nasil meth yapabilecegini bile anlatiyor.
Benim amacım daha çok kod yazma kalitesi yüksek olsun , çok gerekli değil gibi.
 
Bu sisteme bonsai mantıklı gibi bir arkadaş yazmış, ona katılıyorum. Gemma 12B olabilir belki. Bu arada abliterated uncensored heretic modeller çok bozuk oluyor, tam dengeyi tutturamıyorlar; halüsinasyon ve zeka geriliği oluyor. Onun için de yüksek bitleri seçilebilir. Gene de esas modeli gibi olmaz.

Ek bilgi olarak bu adamın ekstra UD uzantılı sıkıştırma yöntemi var, her modele ekliyor. Mesela normal sıkıştırma ile 4 bit bilgisayar kaldırırken, bu modellerde 5 bit yükleme şansı olabiliyor. Ben de Ollama kullanıyorum; ancak Hugging Face'den bu adamın quant modellerine bakarım, uygunsa ondan indiririm. En son Qwen 3.8 27B'yi 5 bit yükledim, baya memnunum.

 
Son düzenleme: