Model Detayları
Chatterbox HD Voice Conversion, konuşan birinin kaydını alıp farklı bir hedef sesle yeniden seslendirir: özgün sözler, zamanlama ve okuyuş korunur, yalnızca konuşmacının ses tınısı değişir. Dönüştürülecek klibi `source_audio_url` olarak verin, ardından hedef sesi iki yoldan biriyle seçin: `target_voice` ile dokuz hazır adlandırılmış sesten birini (`Aurora`, `Blade`, `Britney`, `Carl`, `Cliff`, `Richard`, `Rico`, `Siobhan`, `Vicky`) seçin ya da herhangi bir sesin kısa ve temiz bir örneğini `target_voice_audio_url` ile verip kaydı tam olarak o sese dönüştürün (ikisi birden ayarlanırsa `target_voice` alanını geçersiz kılar). İkisini de boş bırakırsanız rastgele bir hedef ses kullanılır. Çıktı, barındırılan bir WAV dosyasıdır.
Standart Chatterbox ses dönüştürme kademesinden farkı, özenle seçilmiş dokuz adlandırılmış hedef ses ve daha yüksek sadakattir: `high_quality_audio` alanını `true` yaparsanız sonuç, varsayılan 24kHz yerine 48kHz olarak upscale edilir (üretimi daha yavaş, kalitesi daha yüksek). Metinle değil doğrudan sesle çalıştığı için mevcut anlatımları, diyalogları ya da seslendirmeleri hiçbir şeyi yeniden kaydetmeden yeniden seslendirir. Üretilen ses, Resemble AI’ın algısal filigranını taşır.
## En uygun olduğu işler - Mevcut bir kaydı dokuz hazır HD sesten biriyle yeniden seslendirmek ya da dublajlamak - Kısa bir referans örneğinden yola çıkarak bir kaydı belirli bir sese dönüştürmek - 48kHz çıktı kalitesinin önemli olduğu yüksek sadakatli yeniden seslendirme - Sözleri olduğu gibi bırakıp sesini değiştirerek bir konuşmacıyı anonimleştirmek - Farklı kişilerin kaydettiği anlatımları tek ve tutarlı bir seste birleştirmek
## Şu durumlarda başka bir model seçin - Mevcut bir kaydı dönüştürmek yerine yazılı metinden konuşma üretmek istiyorsanız — `resemble-ai/chatterboxhd/text-to-speech` gibi bir text-to-speech modeli kullanın - Sesi değiştirmek yerine konuşmayı metne dökmeniz gerekiyorsa — bir speech-to-text modeli kullanın - Melodisi ve enstrümantasyonu olan bir müzik parçası istiyorsanız — bir müzik üretim modeli kullanın - Konuşma yerine genel ses efektleri ya da ortam sesi istiyorsanız — bir text-to-audio ses efekti modeli kullanın
## İpuçları - `source_audio_url`, sözleri ve okuyuşu korunacak kayıttır — temiz, tek konuşmacılı bir klip verin (WAV ya da MP3). - Tutarlı ve tekrarlanabilir bir sonuç için `target_voice` alanında dokuz adlandırılmış seçenekten birini seçin; varsayılan değer `Aurora`. - Belirli, özel bir sese dönüştürmek için `target_voice_audio_url` alanına temiz, tek konuşmacılı bir örnek verin — `target_voice` alanını geçersiz kılar. - Sadakat önemliyse ve ek latency sorun değilse 48kHz upscale için `high_quality_audio: true` ayarlayın; daha hızlı ve daha ucuz çalıştırmalar için `false` (24kHz) bırakın.
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("resemble-ai/chatterboxhd/speech-to-speech", { input: { source_audio_url: "https://media.modelrunner.ai/RThSDFY174fUmaVkxBj6X.mp3", target_voice: "Aurora", high_quality_audio: true, }, }); ```
