Model Detayları
LatentSync 1.0, bir talking-head videosunu ve ayrı bir konuşma kaydını alır, konuşmacının ağzını yeni sese uyacak şekilde yeniden canlandırır. Kimlik, ışık ve arka plan kaynaktan aynen gelir; yalnızca ağız yeniden üretilir ve sonuç girdinin kare boyutunu korur. Yöntem sese koşullu latent diffusion’dır: Whisper ses embedding’leri, arada landmark ya da hareket temsili olmadan cross-attention ile diffusion modeline aktarılır; TREPA, LPIPS ve SyncNet loss fonksiyonları da ağız hareketini kareden kareye kararlı tutar. Teslim edilen video saniyesi başına $0.014 ile — 20 saniyelik bir klip için yaklaşık $0.28 — katalogdaki en düşük fiyatlı lip-sync modelidir. Net görünen, önden çekilmiş tek bir konuşmacının olduğu bir MP4 ile MP3, AAC, WAV ya da M4A formatında bir konuşma kaydı verin; metin prompt’u yoktur.
## En uygun olduğu işler - Talking-head görüntülerini, dudaklar çevrilmiş seslendirmeye uysun diye başka bir dile dublajlamak - Bir röportajı, eğitim videosunu ya da reklamı daha temiz ya da yeniden kaydedilmiş bir ses çekimiyle yeniden seslendirmek - Kaydedilen konuşma ile ağız hareketlerinin senkrondan kaydığı bir çekimi düzeltmek - Bir text-to-speech modelinin ardına eklemek: önce sesi üretin, ardından görüntüyü bu sese göre lip-sync edin - Saniye başına maliyetin önemli olduğu yüksek hacimli ya da uzun soluklu lip-sync işleri
## Şu durumlarda başka bir model seçin - Süre uyumsuzluğunun nasıl çözüleceğini kontrol etmeniz gerekiyorsa — bu model her zaman ikisinden kısa olana göre keser; `sync/lipsync/v2` ise loop, bounce, silence ve remap seçenekleriyle `sync_mode` sunar - Elinizde görüntü değil durağan bir fotoğraf varsa — bir portreyi canlandırmak için `bytedance/omnihuman/v1.5` ya da `wan-video/wan/v2.7/image-to-video/audio-driven` kullanın - Konuşmayı henüz üretmediyseniz — bu endpoint hazır bir ses dosyası alır ve metin prompt’u almaz; önce bir text-to-speech modeli çalıştırıp çıktısını buraya verin
## İpuçları - Sesi videodan biraz kısa verin: sonuç ikisinden kısa olanın süresi kadar sürer ve 0.64 saniyenin tam katına kırpılır, bu yüzden konuşmanın sonda kalan küçük bir parçası düşer - Kaynak videoyu kabaca ses uzunluğuna kırpın; fazla video atılır ve yalnızca çalıştırmayı yavaşlatır
## Sınırlamalar - Her karede algılanabilir bir yüz olmalı: ara görüntü ya da yüz içermeyen bir kare tüm çalıştırmayı başarısız kılar (ücret alınmaz) - Kare hızı ayarlanamaz — sonuç 25 fps olarak teslim edilir, diğer kare hızları yeniden örneklenir - Ağız detayı sınırlıdır; bu nesil yüksek çözünürlükte eğitilmedi - Ses bandı 16 kHz mono AAC olarak yeniden kodlanıp döner
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("bytedance/latentsync", { input: { video_url: "https://media.modelrunner.ai/NLaN6i1oQvbd8Mn4oEDXs.mp4", audio_url: "https://media.modelrunner.ai/lZfxwe6ZN6ZikXQhVtiq7.wav", }, }); ```


