yusuf68700 adlı üyeden alıntı: mesajı görüntüle
sorun LLM Studiodaymış doğrudan llama İle çalıştırınca Qwen3.6 35B A3B modelde 40 token hızına çıkabildim fakat Qwen 3.8 de en fazla saniyede 4 token hızını görebildim
Elimde birikmiş işler olduğundan dolayı henüz test edemiyorum 3.8 versiyonunu ama 3.6 da sizin de söylediğiniz gibi hızlar o civarda evet. Yine de 4 token çok az geldi bana unsloth'un GGUF versiyonunu deneme imkanınız var ise öneririm çok daha stabil çalışacaktır Windows da.