Arkadaşlar Ne işler için local ai kullanıyorsunuz ? sistemi toplamak için 250 300 bin bir model içni masraf yapmaya gerek var mı ? claude her şeyi hallediyor. ekstra yardımcı olacak bir local ai gerek var mı ? tecrübeleriniz nedir ?
2 ya da daha fazla dgx spark kullanarak lokalde deepsek v4 flash son sürümü, qwen 3.8 flash modelini (1x dgx spark bile yeterli), glm 5.3 flash modellerini çalıştırabilirsiniz. Bu modellerin benchmark skorlarına bakarsanız Opus 4.6 ile 4.8 seviyesinde olduklarını görebilirsiniz. Eğer 4'ten fazla dgx spark olursa doğrudan glm 5.3 modelinin kuantize sürümlerini çalıştırabilirsiniz. 1x dgx spark şu anda ikinci elde 300bin TL bandında.
Öte yandan lokal kullanıcı gpu larında örneğin 1x 3090 da benchmark skorlarında Opus 4.6 seviyesinde olduğu görülen qwen 3.8 27b modelini çalıştırmak ve dflash2 kullanarak saniyede 60 token hızlarına ulaşmak mümkün. Tabi maksimum bağlam uzunluğu 100k ile sınırlı oluyor. Üstelik bu 27b modeli aşırı düşünme modunda çalışırsa vaat ettiği benchmark skorlarına ulaşıyor. Örneğin 4-5k çıktı tokeni vereceği durumlarda 25-30k arası sadece düşünme tokeni harcadığı oluyor.
27b modeli hariç diğer modellerden bile ileri seviye (Fable, Sol vb.) modellerin performansını beklemek abes olur. Ancak Opus 4.8 civarı performans günlük kullanımda gayet yeterli olacaktır. Şahsen elimde 1 adet dgx spark olsaydı qwen 3.8 flash modelini kullanır, ağır kodlama dışında neredeyse bütün işlerimi ona yaptırırdım; buna ufak tefek kodlama ihtiyaçları da dahil.
Tabii bu işin bir de resim, ses ve video gibi LLM dışı bir dünyası var; onlar ayrı bir konu.