CrypticaL adlı üyeden alıntı:
mesajı görüntüle
Qwen3.8-27B - Localde Opus 4.6 Max performansı
37
●2.184
- 15-08-2026, 03:09:11Şüphesiz evet ama MoE ile cpu ya yük bindirip K ve V cache quantization ayarlarını Q8_0 yapınca asıl hız farkı ortaya çıkıyor artı olarak hızlı dikkat seçeneği de fark ettiriyor saniyelik token konusunda bilginiz olsun.yusuf68700 adlı üyeden alıntı: mesajı görüntüle
- 15-08-2026, 03:11:07sorun LLM Studiodaymış doğrudan llama İle çalıştırınca Qwen3.6 35B A3B modelde 40 token hızına çıkabildim fakat Qwen 3.8 de en fazla saniyede 4 token hızını görebildimCrypticaL adlı üyeden alıntı: mesajı görüntüle
- 15-08-2026, 03:15:19Elimde birikmiş işler olduğundan dolayı henüz test edemiyorum 3.8 versiyonunu ama 3.6 da sizin de söylediğiniz gibi hızlar o civarda evet. Yine de 4 token çok az geldi bana unsloth'un GGUF versiyonunu deneme imkanınız var ise öneririm çok daha stabil çalışacaktır Windows da.yusuf68700 adlı üyeden alıntı: mesajı görüntüle
- 15-08-2026, 05:23:39AWS'den EC2 Running On-Demand 4vCPU talep açtım, onaylanırsa kuracağım ilk yapay zeka modeli olacak.
g6e.xlarge açıp L40S 48 GB üzerinde Qwen3.8-27B test edeceğim. - 15-08-2026, 09:31:37Biraz erken, bir kaç sene içerisinde VRAM kapasiteleri arttıkça ve modeller optimize oldukça evimizde ki bilgisayarlar ile localde yapay zeka işlerini sansürsüz yapabileceğiz. Şuan stabil bir sistem kurmak epey maliyetli, localde yapay zekaya kod yazdırmak mevcut giriş, orta seviyesi bilgisayarlar ile pek verimli olmuyor.
- 15-08-2026, 14:03:53Yapay zekalar vram tüketiyor. Normal ram çok birşey ifade etmiyoryusuf68700 adlı üyeden alıntı: mesajı görüntüle
- 15-08-2026, 14:26:36Gerekli optimizasyonlar ile 40 token e çıktım o modeldeA.AY adlı üyeden alıntı: mesajı görüntüle