Sıfırdan indirdiğim veri setleri üzerinden 60 milyon parametreli bir modeli sadece CPU kullanarak eğitiyorum. 300k steplik bir eğitimin 185k sı tamamlandı. Model şimdiden Türkçe cümleler kurmaya başladı. Bağlamla alakalı birkaç bir şey yazıyor ancak daha tam olarak zeki diyemeyiz ancak yine de zekanın nasıl olupta veri setleri üzerinden oluşabildiğine canlı canlı şahit oldum.

Bunu denemek isteyenler için veri setimi paylaşabilirim.

Veri setini indirip denemek isteyenler için paylaşıyorum.

https://huggingface.co/datasets/tasc...sh-llm-dataset

Bu veri seti akademik makalelerden oluşuyor. Bu verisetinin ilk 5 milyon satırını input olarak kullandım ve sadece bu veri setiyle eğitimi gerçekleştirdim. GPU'ya sahipseniz ve sadece Türkçe üzerinde bir eğitim gerçekleştirmek istiyorsanız. Şu veri setleri de işinize yarayabilir;

https://huggingface.co/datasets/lume...sh-corpus-100b
https://huggingface.co/datasets/HuggingFaceFW/fineweb-2
https://huggingface.co/datasets/HuggingFaceFW/finewiki

Paylaştığım son iki linkteki veri setinin sadece Türkçe kısmını çekebilirsiniz.

Benim için iyi bir deneyim oldu. Şimdi SFT eğitim verileriyle de komutu anlama ve yerine getirme çalışması yapacağım. Önerileriniz olursa bana bildirebilirsiniz.