Nordlig adlı üyeden alıntı: mesajı görüntüle
Merhaba, birkaç sorum var.

Öncelikle şunu merak ediyorum: Instagram’da ve diğer sosyal medya platformlarında bazen bir karakter oluşturup videolar çeken kişiler görüyorum. Yani bir “X karakteri” yaratıyorlar, kamera karşısına geçip kendilerini çekiyorlar ama videoda gördüğümüz kişi sanki o karaktermiş gibi davranıyor ve tüm hareketleri o karaktere ait oluyor. Bu tam olarak nasıl yapılıyor?

İkinci sorum ise ağız senkronizasyonu ile ilgili. Oluşturduğum bir karakteri yüklediğimde, yazdığım metne göre otomatik olarak ağız hareketlerini senkronize eden bir yapay zeka var mı?

Son olarak da seslendirme konusunda merak ettiğim bir şey var. Yapay zeka ile yapılan seslendirmelerde konuşmanın daha doğal olması için (vurgular, tonlama, duraklamalar gibi) neler yapılabilir?

Bir proje üzerinde çalışıyorum ancak bu konular hakkında yeterli bilgim yok. Bu nedenle beni aydınlatabilirseniz çok sevinirim.
Karakter oluşturup video çekme meselesi:
Bahsettiğin şey aslında birkaç farklı teknikle yapılıyor. En yaygın olanı şu: kişi kendini normal şekilde çekiyor, sonra yapay zeka ile yüzünü ve vücudunu başka bir karaktere dönüştürüyor. Buna "face swap" ya da "deepfake" tarzı işlemler diyebiliriz ama artık bunun çok ötesine geçildi.
Şu an bu iş için en çok kullanılan araçlar: HeyGen, Synthesia ve D-ID. Bunlarda kendi karakterini oluşturuyorsun, bir fotoğraf ya da tasarım yüklüyorsun, sonra o karakter senin hareketlerinle konuşuyor hareket ediyor. Daha gelişmiş yapanlar RunwayML kullanıyor, orada video üzerinde çok daha detaylı manipülasyon yapabiliyorsun.
Ama Instagram'da gördüğün bazı içerikler var ki adam gerçek zamanlı yapıyor bunu. O da Live face swap teknolojisi, DeepFaceLive gibi araçlarla canlı yayında bile karaktere bürünebiliyorsun. Tabi bu biraz daha teknik bilgi istiyor.
Ağız senkronizasyonu meselesi:
Evet, tam istediğin şeyi yapan araçlar var. Hedra şu an bu işin en iyilerinden, bir karakter görseli yüklüyorsun, metin ya da ses dosyası veriyorsun, karakter o metni konuşuyormuş gibi ağız hareketleri yapıyor. Baya gerçekçi sonuçlar veriyor.
Bunun dışında SadTalker var açık kaynaklı ve ücretsiz, Wav2Lip var bu da ses dosyasına göre ağız senkronizasyonu yapıyor. HeyGen'in de bu özelliği var zaten, hem karakter oluşturma hem lip sync bir arada.
Eğer tek fotoğraftan konuşan karakter yapmak istiyorsan Hedra ya da D-ID ile başla, en kolay onlar.
Doğal seslendirme meselesi:
Bu kısım çok gelişti son dönemde. ElevenLabs şu an seslendirme tarafında en iyi yapay zeka, net söylüyorum. Vurgu, tonlama, duraklama hepsini ayarlayabiliyorsun. Hatta kendi sesini klonlayıp yapay zekanın senin sesinle konuşmasını bile sağlayabiliyorsun.
Doğal çıkması için birkaç trick var: metni yazarken noktalama işaretlerine dikkat et, üç nokta koyarsan duraklıyor, ünlem koyarsan vurguluyor. ElevenLabs'de "stability" ve "clarity" ayarları var, stability'yi biraz düşürürsen daha doğal ve insani bir tonlama yakalıyorsun. Çok yüksek tutarsan robotik kaçıyor.
Bunun dışında MURF AI ve PlayHT de var ama ElevenLabs'in Türkçe desteği ve doğallığı şu an bir adım önde.
Senin projen için önerim:
Eğer komple bir pipeline kuracaksan şöyle git: Karakter tasarımını yap → ElevenLabs ile seslendirmeyi oluştur → Hedra ya da HeyGen ile sesi karaktere lip sync yaptır → gerekirse RunwayML ile son rötuşları yap. Bu akışla profesyonel seviyede içerik çıkartırsın.