• 04-07-2026, 17:12:21
    #1
    Sıfırdan indirdiğim veri setleri üzerinden 60 milyon parametreli bir modeli sadece CPU kullanarak eğitiyorum. 300k steplik bir eğitimin 185k sı tamamlandı. Model şimdiden Türkçe cümleler kurmaya başladı. Bağlamla alakalı birkaç bir şey yazıyor ancak daha tam olarak zeki diyemeyiz ancak yine de zekanın nasıl olupta veri setleri üzerinden oluşabildiğine canlı canlı şahit oldum.

    Bunu denemek isteyenler için veri setimi paylaşabilirim.

    Veri setini indirip denemek isteyenler için paylaşıyorum.

    https://huggingface.co/datasets/tasc...sh-llm-dataset

    Bu veri seti akademik makalelerden oluşuyor. Bu verisetinin ilk 5 milyon satırını input olarak kullandım ve sadece bu veri setiyle eğitimi gerçekleştirdim. GPU'ya sahipseniz ve sadece Türkçe üzerinde bir eğitim gerçekleştirmek istiyorsanız. Şu veri setleri de işinize yarayabilir;

    https://huggingface.co/datasets/lume...sh-corpus-100b
    https://huggingface.co/datasets/HuggingFaceFW/fineweb-2
    https://huggingface.co/datasets/HuggingFaceFW/finewiki

    Paylaştığım son iki linkteki veri setinin sadece Türkçe kısmını çekebilirsiniz.

    Benim için iyi bir deneyim oldu. Şimdi SFT eğitim verileriyle de komutu anlama ve yerine getirme çalışması yapacağım. Önerileriniz olursa bana bildirebilirsiniz.
  • 04-07-2026, 17:38:42
    #2
    Tebrikler hocam. Tavsiyem amerikayı yeniden keşfetmeye çalışıp çok büyük rakiplerle rekabet etmeye çalışıp şevkinizin kırılmasına sebep olmaktansa, onların yaptıklarını geliştirmeniz veya onların yaptıkları ile yeni birşeyler yapmanız...

    Başarılar..
  • 04-07-2026, 17:45:55
    #3
    ravenol adlı üyeden alıntı: mesajı görüntüle
    Tebrikler hocam. Tavsiyem amerikayı yeniden keşfetmeye çalışıp çok büyük rakiplerle rekabet etmeye çalışıp şevkinizin kırılmasına sebep olmaktansa, onların yaptıklarını geliştirmeniz veya onların yaptıkları ile yeni birşeyler yapmanız...

    Başarılar..
    Zaten kullanıyorum ancak bir modelin nasıl eğitildiği ile ilgili detaylı bir araştırma yaptım ve sonra Codex ile birlikte süre kıstasını doğru değerlendirerek CPU ile sabredebileceğim büyüklükte bir modelin eğitim kodlarını birlikte yazdık ve sonra çalıştırdım. Kod 4-5 gündür çalışıyor ve bir 6 gün daha var sanırım.

    Zekanın yavaş yavaş piştiğini deneyimlemek benim için çok öğretici ve ikna edici oldu. Yoksa şu LLMlerin ardında acaba Pakistanlı klavyesi güçlü operatörler mi var diye şüpheleniyordum.
  • 04-07-2026, 17:47:02
    #4
    ravenol adlı üyeden alıntı: mesajı görüntüle
    Tebrikler hocam. Tavsiyem amerikayı yeniden keşfetmeye çalışıp çok büyük rakiplerle rekabet etmeye çalışıp şevkinizin kırılmasına sebep olmaktansa, onların yaptıklarını geliştirmeniz veya onların yaptıkları ile yeni birşeyler yapmanız...

    Başarılar..
    Sistem zaten kendi öğreniyor. Niye adam hevesini kursağında bırakıyorsun?
  • 04-07-2026, 17:58:13
    #5
    Hocam ben de vektörler ve kosinüs hesaplamaları yerine farklı bir metodoloji ile geliştirdim iki adet LLM (deneysel boyutta).
    Tabi vaktim olmadığı için askıda kaldı. Amacım kendimi geliştirmekti.
    Mimariden biraz bahseder misiniz?
    Training, decoder, attention vesaire kendiniz mi kurguladınız?
  • 04-07-2026, 18:06:58
    #6
    Hocam başarılar önerim bir alan üzerinden eğitip sonrasında daha da geliştirmeniz olur.
    Şuan en çok kodlama alanı iyi olur gib.
  • 04-07-2026, 18:09:29
    #7
    gecoist adlı üyeden alıntı: mesajı görüntüle
    Hocam ben de vektörler ve kosinüs hesaplamaları yerine farklı bir metodoloji ile geliştirdim iki adet LLM (deneysel boyutta).
    Tabi vaktim olmadığı için askıda kaldı. Amacım kendimi geliştirmekti.
    Mimariden biraz bahseder misiniz?
    Tarining, decoder, attention vesaire kendiniz mi kurguladınız?


    Kullandığımız yapay sinir ağı:
    Transformer tabanlı, decoder-only, causal language model

    Transformer türleri:
    encoder-only
    encoder-decoder
    decoder-only

    decoder-only:

    Bu GPT tarzıdır.

    Örnek modeller:

    GPT
    LLaMA
    Mistral
    OLMo
    DeepSeek
    Qwen
    Gemma

    Causal Ne Demek?

    Causal şu demek:
    Model geleceği göremez.

    Yani model şu diziyi işlerken:

    Türkiye'nin başkenti Ankara'dır.

    başkenti tokenını tahmin ederken daha sonraki Ankara'dır kısmını göremez.
    Sadece önceki tokenlara bakabilir.

    Bu yüzden buna:

    "causal language model" denir.

    Bizim mini-GPT modelimizde şunlar var:

    token embedding
    RoPE positional encoding
    causal self-attention
    MLP (Multi-Layer Perceptron) / SwiGLU
    RMSNorm
    decoder-only transformer blocks
    language modeling head

    Codex ile tartışırken oluşturacağımız mndelin özelliklerini not almıştım. Bu modelin genel hatlarıyla özellikleri bir çoğunu anladığımı düşünüyorum ancak KV Cache vb. daha gidilecek çok yol var. Bu nano gpt gibi bir çalışma oldu.
  • 04-07-2026, 18:10:24
    #8
    hocam daha önce LLM geliştirmiş biri olarak emeğini takdir ediyorum başarılarının devamını dilerim
  • 04-07-2026, 18:16:52
    #9
    Pos3idon adlı üyeden alıntı: mesajı görüntüle
    hocam daha önce LLM geliştirmiş biri olarak emeğini takdir ediyorum başarılarının devamını dilerim
    Teşekkürler. Sizin geliştirdiğiniz model nasıldı? Kullanımda mı?