Kullandığımız yapay sinir ağı:
Transformer tabanlı, decoder-only, causal language model
Transformer türleri:
encoder-only
encoder-decoder
decoder-only
decoder-only:
Bu GPT tarzıdır.
Örnek modeller:
GPT
LLaMA
Mistral
OLMo
DeepSeek
Qwen
Gemma
Causal Ne Demek?
Causal şu demek:
Model geleceği göremez.
Yani model şu diziyi işlerken:
Türkiye'nin başkenti Ankara'dır.
başkenti tokenını tahmin ederken daha sonraki Ankara'dır kısmını göremez.
Sadece önceki tokenlara bakabilir.
Bu yüzden buna:
"causal language model" denir.
Bizim mini-GPT modelimizde şunlar var:
token embedding
RoPE positional encoding
causal self-attention
MLP (Multi-Layer Perceptron) / SwiGLU
RMSNorm
decoder-only transformer blocks
language modeling head
Codex ile tartışırken oluşturacağımız mndelin özelliklerini not almıştım. Bu modelin genel hatlarıyla özellikleri bir çoğunu anladığımı düşünüyorum ancak KV Chache vb. daha gidilecek çok yol var. Bu nano gpt gibi bir çalışma oldu.
Emeğinize sağlık hocam. Evet yapay zeka derya deniz, sonu yok. Ayrıca yapay zeka konusunda insanlık henüz emekleme dönemine bile girmedi. Ama biz ülkecek çok daha gerisindeyiz olayın maalesef.
Bu da benim geliştirdiğim Graph uzayında fizik motoru ile çalışan llm denemem. Decoder ve dikkat mekanizmasını tam oturtamadım. LLM modellerinden tamamen farklı bir mimariye sahip. Her an yeni bilgiler ile eğitilebilsin ve GPU ihtiyacı olmadan çalışabilsin diye geliştiriyordum. Ama eksiği çok fazla. Casual bağları ile sinaptik rota çizerek cevap üretmeye çalışıyor. Hatta sıfır eğitim ile ARC AGI oyunu oynattım, bir çok LLM den daha iyi sonuç verdi. Bakalım vakit olursa sevdiğim bir alan, biraz daha uğraşacağım.