CrypticaL adlı üyeden alıntı: mesajı görüntüle
Şüphesiz evet ama MoE ile cpu ya yük bindirip K ve V cache quantization ayarlarını Q8_0 yapınca asıl hız farkı ortaya çıkıyor artı olarak hızlı dikkat seçeneği de fark ettiriyor saniyelik token konusunda bilginiz olsun.
sorun LLM Studiodaymış doğrudan llama İle çalıştırınca Qwen3.6 35B A3B modelde 40 token hızına çıkabildim fakat Qwen 3.8 de en fazla saniyede 4 token hızını görebildim