Model Detayları
Chatterbox HD, yazılı metni doğal ve ifadeli bir konuşmaya dönüştürür ve barındırılan bir WAV dosyası döndürür. Kullanıma hazır dokuz adlandırılmış sesle gelir (`Aurora`, `Blade`, `Britney`, `Carl`, `Cliff`, `Richard`, `Rico`, `Siobhan`, `Vicky`) ve bir sesi zero-shot olarak da klonlayabilir: `audio_url` ile kısa bir referans kayıt verin, metninizi o sesle okusun — eğitim ya da ses profili oluşturma adımı gerekmez. Standart Chatterbox kademesinden ayrıldığı nokta sadakattir: `high_quality_audio` alanını `true` yaparsanız çıktı, varsayılan 24kHz yerine 48kHz olarak upscale edilir (üretimi daha yavaş, kalitesi daha yüksek). `exaggeration` duygu yoğunluğunu ayarlar; bu da onu karakter diyalogları, seçtiğiniz bir sesle anlatım ve düz, nötr bir TTS’in yetersiz kalacağı ifadeli okumalar için güçlü bir tercih yapar.
## En uygun olduğu işler - 48kHz çıktı kalitesinin önemli olduğu yüksek sadakatli seslendirme ve anlatım - Klonlamaya gerek kalmadan dokuz adlandırılmış seçenek arasından kendine özgü, hazır bir ses seçmek - Karakter diyalogları ya da anlatım için kısa bir referans klipten belirli bir sesi klonlamak - Yoğunluğu ayarlanabilen ifadeli, duygu yüklü okumalar - Eğitim ya da ses profili oluşturma adımı olmadan hızlıca özel bir ses prototiplemek
## Şu durumlarda başka bir model seçin - Dil seçici sunan bir modelle İngilizce dışındaki bir dilde konuşma gerekiyorsa — çok dilli Chatterbox varyantını kullanın - Metinden sentezlemek yerine mevcut bir kaydı farklı bir sese dönüştürmek istiyorsanız — speech-to-speech bir ses değiştirici kullanın - Melodisi ve enstrümantasyonu olan bir müzik parçası istiyorsanız — bir müzik üretim modeli kullanın - Konuşma üretmek yerine konuşmayı metne dökmeniz gerekiyorsa — bir speech-to-text modeli kullanın
## İpuçları - Tutarlı ve tekrarlanabilir bir sonuç için dokuz adlandırılmış seçenekten bir `voice` seçin; `voice` ve `audio_url` alanlarının ikisi de boş kalırsa rastgele bir ses seçilir, bu yüzden deterministik çıktı için birini ayarlayın. - Bir sesi klonlamak için `audio_url` alanına temiz, tek konuşmacılı bir referans klip verin — `voice` alanını geçersiz kılar. - Sadakat önemliyse ve ek latency sorun değilse 48kHz upscale için `high_quality_audio: true` ayarlayın; daha hızlı ve daha ucuz okumalar için `false` (24kHz) bırakın. - Girdi metnini okunmasını istediğiniz gibi noktalayın — virgüller ve noktalar duraklamaları ve tonlamayı belirler.
## Gelişmiş Yapılandırma - `exaggeration` (0.25–2.0, varsayılan 0.5): duygu ve yoğunluk abartısı. Yüksek değerler daha dramatik, düşük değerler daha sakin ve ölçülü bir okuyuş verir. - `cfg` (0.0–1.0, varsayılan 0.5): classifier-free guidance ağırlığı. İfadeli ya da dramatik konuşma için düşük değerleri (~0.3) deneyin ve `exaggeration` değerini ~0.7+ seviyesine çıkarın. Referans konuşmacı hızlı konuşuyorsa `cfg` değerini ~0.3’e düşürmek tempoyu iyileştirebilir. - `temperature` (0.05–5.0, varsayılan 0.8): sampling temperature. Düşük değerler daha istikrarlı ve öngörülebilir sonuç verir; yüksek değerler prozodiye ve okuyuşa çeşitlilik katar. - `seed` (varsayılan 0 = rastgele): bir üretimi tekrarlanabilir kılmak için sabit bir tam sayı verin.
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("resemble-ai/chatterboxhd/text-to-speech", { input: { text: "Welcome to ModelRunner. This is high-definition text to speech.", voice: "Aurora", high_quality_audio: true, }, }); ```
