Sıfırdan indirdiğim veri setleri üzerinden 60 milyon parametreli bir modeli sadece CPU kullanarak eğitiyorum. 300k steplik bir eğitimin 185k sı tamamlandı. Model şimdiden Türkçe cümleler kurmaya başladı. Bağlamla alakalı birkaç bir şey yazıyor ancak daha tam olarak zeki diyemeyiz ancak yine de zekanın nasıl olupta veri setleri üzerinden oluşabildiğine canlı canlı şahit oldum.
Bunu denemek isteyenler için veri setimi paylaşabilirim.
Veri setini indirip denemek isteyenler için paylaşıyorum.
https://huggingface.co/datasets/tasc...sh-llm-dataset
Bu veri seti akademik makalelerden oluşuyor. Bu verisetinin ilk 5 milyon satırını input olarak kullandım ve sadece bu veri setiyle eğitimi gerçekleştirdim. GPU'ya sahipseniz ve sadece Türkçe üzerinde bir eğitim gerçekleştirmek istiyorsanız. Şu veri setleri de işinize yarayabilir;
https://huggingface.co/datasets/lume...sh-corpus-100b
https://huggingface.co/datasets/HuggingFaceFW/fineweb-2
https://huggingface.co/datasets/HuggingFaceFW/finewiki
Paylaştığım son iki linkteki veri setinin sadece Türkçe kısmını çekebilirsiniz.
Benim için iyi bir deneyim oldu. Şimdi SFT eğitim verileriyle de komutu anlama ve yerine getirme çalışması yapacağım. Önerileriniz olursa bana bildirebilirsiniz.
Sıfırdan LLM geliştirmeyi deneyen var mı?
17
●636
- 04-07-2026, 17:12:21
- 04-07-2026, 17:45:55Zaten kullanıyorum ancak bir modelin nasıl eğitildiği ile ilgili detaylı bir araştırma yaptım ve sonra Codex ile birlikte süre kıstasını doğru değerlendirerek CPU ile sabredebileceğim büyüklükte bir modelin eğitim kodlarını birlikte yazdık ve sonra çalıştırdım. Kod 4-5 gündür çalışıyor ve bir 6 gün daha var sanırım.ravenol adlı üyeden alıntı: mesajı görüntüle
Zekanın yavaş yavaş piştiğini deneyimlemek benim için çok öğretici ve ikna edici oldu. Yoksa şu LLMlerin ardında acaba Pakistanlı klavyesi güçlü operatörler mi var diye şüpheleniyordum.
- 04-07-2026, 17:47:02Sistem zaten kendi öğreniyor. Niye adam hevesini kursağında bırakıyorsun?ravenol adlı üyeden alıntı: mesajı görüntüle
- 04-07-2026, 17:58:13Hocam ben de vektörler ve kosinüs hesaplamaları yerine farklı bir metodoloji ile geliştirdim iki adet LLM (deneysel boyutta).
Tabi vaktim olmadığı için askıda kaldı. Amacım kendimi geliştirmekti.
Mimariden biraz bahseder misiniz?
Training, decoder, attention vesaire kendiniz mi kurguladınız? - 04-07-2026, 18:09:29gecoist adlı üyeden alıntı: mesajı görüntüle
Kullandığımız yapay sinir ağı:
Transformer tabanlı, decoder-only, causal language model
Transformer türleri:
encoder-only
encoder-decoder
decoder-only
decoder-only:
Bu GPT tarzıdır.
Örnek modeller:
GPT
LLaMA
Mistral
OLMo
DeepSeek
Qwen
Gemma
Causal Ne Demek?
Causal şu demek:
Model geleceği göremez.
Yani model şu diziyi işlerken:
Türkiye'nin başkenti Ankara'dır.
başkenti tokenını tahmin ederken daha sonraki Ankara'dır kısmını göremez.
Sadece önceki tokenlara bakabilir.
Bu yüzden buna:
"causal language model" denir.
Bizim mini-GPT modelimizde şunlar var:
token embedding
RoPE positional encoding
causal self-attention
MLP (Multi-Layer Perceptron) / SwiGLU
RMSNorm
decoder-only transformer blocks
language modeling head
Codex ile tartışırken oluşturacağımız mndelin özelliklerini not almıştım. Bu modelin genel hatlarıyla özellikleri bir çoğunu anladığımı düşünüyorum ancak KV Cache vb. daha gidilecek çok yol var. Bu nano gpt gibi bir çalışma oldu. - 04-07-2026, 18:16:52Teşekkürler. Sizin geliştirdiğiniz model nasıldı? Kullanımda mı?Pos3idon adlı üyeden alıntı: mesajı görüntüle