arkadaşlar, öncelikle iyi çalışmalar, video edit üşendiğim için ufak bir program geliştirmeye çalışıyorum, mantık şu şekilde...
"gemma 4 e4b it litert" modelini öğretmen model yapıp ufak bir multimodal state sınıflandırma modeli geliştirmek istiyorum, yani program çalıştığı süre boyunca her 5 saniye boyunca kayıt alacak ve bu kayıt içinde hem ses, hem ekran, hem de kamera verisi olacak, ancak yazılımcı değilim, yani modeli kendi kullanımım için geliştirmeyi düşünüyorum, amacım şu tarz soruları cevaplatmak gerçek zamanlı olarak:
- bu N süre boyunca duyulan ses düzeyi hangisi?
- low
- medium
- high
- bu N süre boyunca Ekran Kaydı hızlı mı akıyor yavaş mı?
- true
- false
- bu N süre boyunca kamera kaydında kişi var mı?
- true
- false
vb gibi tek bir json input verip json output almak istiyorum, kısaca jev isimli modelin çok ufak çaplı hali gibi düşünün ve multimodal olacak falan?
bu işi nasıl hallederim? fikir olarak neler yapabilirim? nasıl yaparım? şimdiden teşekkürler...