gecoist adlı üyeden alıntı: mesajı görüntüle
Hocam ben de vektörler ve kosinüs hesaplamaları yerine farklı bir metodoloji ile geliştirdim iki adet LLM (deneysel boyutta).
Tabi vaktim olmadığı için askıda kaldı. Amacım kendimi geliştirmekti.
Mimariden biraz bahseder misiniz?
Tarining, decoder, attention vesaire kendiniz mi kurguladınız?


Kullandığımız yapay sinir ağı:
Transformer tabanlı, decoder-only, causal language model

Transformer türleri:
encoder-only
encoder-decoder
decoder-only

decoder-only:

Bu GPT tarzıdır.

Örnek modeller:

GPT
LLaMA
Mistral
OLMo
DeepSeek
Qwen
Gemma

Causal Ne Demek?

Causal şu demek:
Model geleceği göremez.

Yani model şu diziyi işlerken:

Türkiye'nin başkenti Ankara'dır.

başkenti tokenını tahmin ederken daha sonraki Ankara'dır kısmını göremez.
Sadece önceki tokenlara bakabilir.

Bu yüzden buna:

"causal language model" denir.

Bizim mini-GPT modelimizde şunlar var:

token embedding
RoPE positional encoding
causal self-attention
MLP (Multi-Layer Perceptron) / SwiGLU
RMSNorm
decoder-only transformer blocks
language modeling head

Codex ile tartışırken oluşturacağımız mndelin özelliklerini not almıştım. Bu modelin genel hatlarıyla özellikleri bir çoğunu anladığımı düşünüyorum ancak KV Cache vb. daha gidilecek çok yol var. Bu nano gpt gibi bir çalışma oldu.