Model Detayları
OmniHuman 1.5, bir kişinin tek bir durağan fotoğrafını ve bir ses kaydını talking-head videosuna dönüştürür: öznenin ağzı, mimikleri ve baş/vücut hareketleri sesteki konuşma ya da şarkıya uyacak şekilde canlandırılır; genel hareketi ve performansı yönlendirmek için isteğe bağlı bir metin prompt’u verebilirsiniz. Net bir portre ve söylemesini istediğiniz sesi verin, o kişinin bunu söylediği bir MP4 alın. Güçlü yanı, tek bir görselden sıkı ses güdümlü dudak ve yüz senkronu ile inandırıcı, robotik olmayan vücut hareketi üretmesidir.
## En uygun olduğu işler - Bir vesikalık ya da portreyi, seslendirme veya anlatıma dudak senkronu yapan bir sözcü videosuna dönüştürmek - Açıklayıcı videolar, reklamlar, eğitimler ve ürün demoları için avatar ve dijital sunucu klipleri - Bir karakteri ya da illüstrasyonu verilen ses kaydıyla eş zamanlı şarkı söyletmek veya konuşturmak - Çevrilmiş sesin hazır olduğu yerelleştirilmiş/dublajlı talking-head klipleri - Tek fotoğraf ve sesten hızlı sosyal medya ya da UGC tarzı talking-head içerik
## Şu durumlarda başka bir model seçin - Elinizde zaten bir talking-head video varsa ve durağan fotoğraf canlandırmak yerine yalnızca dudakları yeni sese göre yeniden senkronlamak istiyorsanız — bir lip-sync (video-to-video) modeli kullanın - Ses olmadan, yalnızca metin prompt’undan bir sahneyi ya da nesneyi canlandırmak istiyorsanız — image-to-video ya da text-to-video modeli kullanın - Hareketi yönlendirecek konuşma ve ses kaydı olmayan sıradan bir image-to-video klip gerekiyorsa — standart bir image-to-video modeli kullanın
## İpuçları - En doğru senkron için yüzün tamamının görünür ve engelsiz olduğu, net, önden çekilmiş bir fotoğraf kullanın - Ses süresi çözünürlüğe göre sınırlıdır: 1080p’de sesi 30s’nin, 720p’de 60s’nin altında tutun - Jestleri, enerjiyi ve kamera hissini yönlendirmek için `prompt` kullanın (ör. "sakin sunucu, hafif baş sallama"); her şeyi sesin yönetmesi için boş bırakın - Fotoğrafta birden fazla kişi varsa `mask_url` ile bir maske görseli verin — yalnızca maskenin beyaz bölgesindeki kişi konuşturulur - `turbo_mode`, ek ücret olmadan daha hızlı üretim karşılığında kaliteden biraz ödün verir
## Sınırlamalar - Ses kaydıyla yönlendirilen insan özneler için tasarlandı; insan olmayan özneler ya da net konuşma/vokal sinyali olmayan sesler daha zayıf sonuç verir - Çok uzun klipler, çözünürlük başına ses süresi sınırlarına uymak için bölünmelidir
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("bytedance/omnihuman/v1.5", { input: { image_url: "https://media.modelrunner.ai/ho4HXHjCrHjv7MZs-omnihuman_v15_input_image.png", audio_url: "https://media.modelrunner.ai/v293WP0BkvLcoXC3MJLud.mp3", prompt: "natural presenter delivering the line, subtle head movement", resolution: "1080p", }, }); ```


