likable03 adlı üyeden alıntı: mesajı görüntüle
1. Kendim eğiteyim bana ait olsun model
2. İleride lisans sebebiyle dava açarlar.
Biz eğittik üzerine çöktün ticari amaçlı yasak filan derler. Atıfta bulunmak zorunda kalmayacağım lisans problemi yaşamayacağım bir açık kaynak var mı? Birde mevcut ekran kartı gayet hızlı gece gündüz eğitiyor. Şimdi 3B eğitime hazırlanıyorum 60-90B tokene ihtiyacım var. Açık kaynak WET veri bile lisans telif diyorlar. CommonCrawl’dan veri çekip temizlesem spam ve tekrar ayıklaması yapsam eğitsem lisans telif yermiyim bilginiz var mı?

1- Apache lisansına sahip modelleri istediğiniz gibi kullanabilirsiniz. Peki hangi modeller var? Gemma 4 ailesi, Qwen 3.6 ailesi gibi modeller, yerel donanımda çalıştırılabilecek en güçlü modeller arasında yer alıyor.

2- Hayır, dava açamazlar. Çünkü bu modeller Apache 2.0 lisansı ile paylaşılmıştır. Bunun anlamı şudur: Modele istediğiniz değişikliği yapabilir, hatta daha sonra kapalı kaynak olarak ticari amaçlarla bile kullanabilirsiniz. Apache 2.0 lisansı ile paylaşıldıkları için bu konuda herhangi bir hukuki engel bulunmaz.

3- Sizin eğittiğiniz modelde görsel (vision) yetenekleri bulunmuyor; yalnızca metin odaklı olarak eğitiyorsunuz. Oysa Gemma 4 31B gibi bir model, gelişmiş vision yetenekleri sayesinde görüntüleri de işleyebilen multimodal bir yapıya sahiptir. Sıfırdan model eğitmek, belki sürecin nasıl işlediğini ve ilk yapay zekâ modellerinin nasıl ortaya çıktığını anlamak açısından faydalı olabilir. Ancak pratik açıdan, sıfırdan eğitim yapmak yerine mevcut güçlü bir modelin üzerine süper ince ayar (super fine-tuning) yapmak çok daha mantıklı bir yaklaşımdır.

4- OpenAI, Anthropic gibi firmalar, eğitim verilerinin telif hakları nedeniyle çeşitli davalarla karşı karşıya kalıyorlar. Ancak burada önemli bir nokta var: Bir şirket, kullandığı veriler hakkında açık bir şekilde bilgi vermediği sürece, bunun kanıtlanması ve hukuki olarak ispatlanması oldukça zor olabiliyor. Bu nedenle yapay zekâ eğitim verilerinin kullanımı günümüzde hâlâ büyük ölçüde gri bir alan olarak değerlendiriliyor.

Sizin geliştireceğiniz model için de benzer bir durum geçerli. Teknik olarak modeli eğitirken farklı veri kaynakları kullanılabilir. Ancak model eğitildikten sonra, kullandığınız veri setindeki içerikleri birebir şekilde yeniden üretmediği ve veri setindeki eserleri kopyalamadığı sürece, telif hakkı ihlali iddialarının hukuki olarak kanıtlanması çok daha zor hâle gelir. Bununla birlikte bu alanın hukuk açısından hâlen gelişmekte olan ve ülkelere göre değişen bir konu olduğunu unutmamak gerekir.

metni yapay zekadan almadım; sadece noktalama işaretleri düzeltmesi yaptırdım.