forumda en çok sizin mesajlarınızı okumaktan keyif alıyorum, hiç üşenmeden uzun uzun yazabiliyorsunuz çünkü. açıkça belirteyim, ben sizin kadar profesyonel olmadığımın bilincinde ve farkındayım. benim alanım web teknolojileri ile sınırlı, bir nokta da yapılan çoğu iş aslında veritabanında bulunan değerleri anlamlı bir şekilde kullanıcıya sunmaktan ibaret yani işim. ki buna rağmen bende asla tam kontrol verme taraftarı değilim. çünkü mantıklı kararlar almak yerine sizin örneğinizdeki gibi sonuca ulaşmayı hedeflediğini biliyorum ve bunu ilk akla gelen en basit yöntemler ile uyguluyor; bir sorunu çözmek için olası pek çok soruna da davetiye çıkarıyor. ancak bir noktadan sonra insan iradesi de kırılıyor, tıpkı sosyal medyaya bağımlığı yaşayan gençler gibi. tembelliğimiz, bazı şeyleri gözardı etmememize neden oluyor. ne yalan söyleyim, ben bulut üzeriden modelleri kullanıyorum. sahip olduğum donanımlar yerel modelleri çalıştırmaya yetiyor sadece, ancak token üretim süresi çok ciddi ölçüde uzun sürüyor. yanıtlamak isterseniz, pm atıp hem donanımsal hemde model kullanımı hakkında birkaç soru sormak ve kısa bir reçete gibi tavsiyelerinizi almayı çok isterim.
Aslında hiç devlet sırrı değil. Ya çok bütçeniz vardır $50k-$60k bedeli olan kartları yan yana dizersiniz, ya da mantık çerçevesinde yapabileceğiniz en akıllı yatırıma yönelirsiniz: Mac Studio. Size 100 gb üzerinde VRAM veren bir yapı zaten başlı başına aldığı bedeli hak eder. Bu da sizin token üretim konusundaki sıkıntınız. Token üretimi CPU+RAM şeklindeyse, 1-4t/s gibi üretim hızınır olur. Ancak, VRAM'e tüm modeli koyup, CPU ve RAM'i ana hedef olmaktan çıkarırsanız, yazım hızınız 1-4t/s'den 70t/s gibi üst seviyelere rahatlıkla çıkabilir. Bu elbette alacağınız ürünün teknik yeterliliği ile ilişkili bir mesele.
Mac Studio'nun 80'lik GPU modelini aldınız, sıra model seçmede.
Qwen 3.8 en güzel offline, çok akıllı olmayan ve hızlı ihtiyaç giderebilen modelerden biri.
GLM 5.3, Qwen'e göre biraz daha akıllıdır ama mimar değildir.
DeepSeek v4 Pro kimilerinin tercihi ama benim çok tercih ettiğim bir model değil.
Bu üç model de hatalarla dolu. Yani, mimari yapsın diyorsanız, çok uzun yol gitmeniz gerek ya da API ile Cloud modelden mimari yazdırıp, sonra offline modelde devam etmeniz gerek. Cloud modellerin ücretsiz sınırlı kullanım olanakları var. Bunlarla sınırlı kullanımı yapıp ihtiyacınızı karşılarsınız, sonra kod kısmında offline a geçersiniz.
ÖNEMLİ: VRAM boyutunuza göre model seçiyorsunuz. Yani, eğer 8 gb ekran kartınız varsan, Qwen 3.8 27b çalıştırmak isterseniz, hem GGUF olmak zorunda olur hem de Ram+CPU olur, haliyle o ekran kartı ile hiçbir şey olmaz. Ancak, 24 gb ekran kartınız vardır, daha esnek olursunuz. 60 gb üstü vardır, sıkıştırma yapmadan tüm modeli koyabilir hale gelirsiniz. Mac Studiolarda 192 gb VRAM yapabiliyorsunuz ve bunu unified olarak 512 gb a çıkarabiliyorsunuz. Bunun normal hardware karşılığı malesef tonla yatırım gerektiriyor. 8 yıl önce çıkan $2000 değeri olan grafik kartları şu anda $5500 civarından gidiyor. Haliyle, konu aslında grafik kartına bakıyor.
Yapay zeka modeli olarak:
Hem OpenAI hem de Claude iyi bir mimari yaratabilir ancak asla kusursuz olamaz ve tekrar tekrar yapacak iş çıkarır. Çoğu durumda kendi yaptığı işi tekrar tekrar düzeltmek zorunda kalır ve bunu yaparken size asla bilgi vermez. Sizden aldığı cümleyi inceler ve aradan kaptığı bir kelimeye göre bir sonuca gider. Sonuçta yapay zeka dediğiniz, mesaj kutularının belli değerleri çektiği bir akıllı havuz sisteminden ibaret. Haliyle, prompt içerisinde geçen tek bir kelime, bazen tüm projeye yönlendirme yapabilir. Onu bir insan gibi düşünmeyin. Tamamen makine dili konuşuyorsunuz.
GLM; Qwen, DeepSeek, Kimi gibi modellere göre bir tık daha iyi. Qwen tamamen programlama odaklı, Kimi mimari açıdan Flagship modellere kafa tutabilir, yani OpenAI ve Claude alternatifi. DeepSeek sadece coding kısmında olabilir. Farkındaysanız hiç Geminiden bahsetmedim. Merak etmeyin, Google'da bahsetmiyor. En basitinden Pro Extended model ile Flash model arasındaki zeka farkı, Profesör ile yeni doğmuş bir bebek arasındaki bilgi farkına benziyor.
Deneyimler kişiseldir. Farklı insanlar farklı sonuçlara gitmiş olabilir. Benim gözlemlemem bu şekilde.