Hocam verdiğiniz rakamlar günlük yaklaşık 600M, aylık 18 milyar token seviyesine geliyor. Bu ölçekte “500 TL öde 5.000 TL kredi kullan” tarzı sistemleri sürekli kullanmak pek sürdürülebilir değil; genelde startup/promosyon kredisi olarak veriliyor ve production kullanımına limit koyabiliyorlar.
Bence 3 yol var:
- AWS/Azure/Nebius benzeri startup credit programlarını kovalamak
- Sağlayıcılarla doğrudan yüksek hacimli enterprise/commit anlaşması yapmak
- DeepSeek V4 tarafında open-weight modeli dedicated GPU üzerinde self-host etmek
Özellikle global filtre istemiyorsanız DeepSeek self-host tarafı daha mantıklı. Gemini kapalı model olduğu için üçüncü taraf bir sağlayıcıda tamamen filtresiz kullanım garantisi beklemek zor. Bu hacimdeyseniz ayrıca token caching ciddi fark yaratır. DeepSeek V4 Flash'ta cache hit fiyatı normal input maliyetinden çok daha düşük.
Hocam enterprise anlaşmasıda yapsak asla yetişemeyeceğimiz faturalar çıkıyor, startup desteklerine genelde olumsuz cevap geliyor baya uzun ve sıkıcı bir süreç.
Self host kısmında ise deepseek v4 flashı hostlamak aşırı kaynak isteyen bir şey, ona'da yetişemiyoruz, harici olarak hesaplı bir şekilde örneğin L4 Gpu'larda v.s. çalışacak fine-tune ile roleplay kavramını öğretebileceğimiz bir model istiyoruz, ancak önemli olan Türkçe dilinin iyi olması. Ve 9-14b modellerin hepsinin Türkçesi berbat.