Model Detayları
Chatterbox, yazılı metni doğal ve ifadeli bir konuşmaya dönüştürür ve barındırılan bir WAV dosyası döndürür. En güçlü yanı zero-shot ses klonlamadır: kısa bir referans kayıt verin, metninizi o sesle okusun — eğitim ya da ses profili oluşturma adımı gerekmez. Referansı vermezseniz yerleşik varsayılan bir sesle okur. `exaggeration` kontrolü duygu yoğunluğunu artırıp azaltır; girdi metni de okuyuşu yer yer renklendirmek için `<laugh>`, `<sigh>`, `<gasp>` ve `<cough>` gibi satır içi duygu etiketlerini kabul eder. Bu da onu karakter diyalogları, belirli bir kişinin sesiyle anlatım ve düz, nötr bir TTS’in yetersiz kalacağı ifadeli okumalar için güçlü bir varsayılan tercih yapar.
## En uygun olduğu işler - Anlatım ya da karakter diyalogları için kısa bir örnekten belirli bir sesi klonlamak - Okuyuşta gülme, iç çekme ya da şaşkınlıkla nefesin kesilmesi gibi anlar istediğiniz ifadeli, duygu yüklü okumalar - Düz bir okuma yerine karakter isteyen seslendirmeler ve dramatize içerikler - Eğitim ya da ses profili oluşturma adımı olmadan hızlıca özel bir ses prototiplemek
## Şu durumlarda başka bir model seçin - Kendi sesinizi klonlamak yerine adlandırılmış, hazır seslerden oluşan geniş bir kütüphane gerekiyorsa — hazır ses kataloğu sunan bir TTS modeli kullanın - Melodisi ve enstrümantasyonu olan bir müzik parçası istiyorsanız — bir müzik üretim modeli kullanın - Konuşma yerine genel ses efektleri ya da ortam sesi istiyorsanız — bir text-to-audio ses efekti modeli kullanın - Konuşma üretmek yerine konuşmayı metne dökmeniz gerekiyorsa — bir speech-to-text modeli kullanın
## İpuçları - Bir sesi klonlamak için `audio_url` alanına temiz, tek konuşmacılı bir referans klip verin; yerleşik varsayılan sesi kullanmak için boş bırakın. - Okuyuşu belirli noktalarda şekillendirmek için `<laugh>`, `<sigh>`, `<gasp>` ya da `<cough>` gibi etiketleri doğrudan `text` içine ekleyin. - Daha dramatik ve duygusal bir okuyuş için `exaggeration` değerini yükseltin (0.0–1.0, varsayılan 0.25); sakin ve ölçülü okumalar için düşük tutun. - Girdi metnini okunmasını istediğiniz gibi noktalayın — virgüller ve noktalar duraklamaları ve tonlamayı belirler.
## Gelişmiş Yapılandırma - `temperature` (0.05–2.0, varsayılan 0.7): sampling temperature. Düşük değerler daha istikrarlı ve öngörülebilir sonuç verir; yüksek değerler prozodiye ve okuyuşa çeşitlilik katar. - `cfg` (0.1–1.0, varsayılan 0.5): classifier-free guidance ağırlığı. Yüksek değerler referans sesi ve prompt’u daha yakından izler; düşük değerler modele daha fazla serbestlik tanır. - `seed` (varsayılan olarak boş, 0 = rastgele): bir üretimi tekrarlanabilir kılmak için sabit bir tam sayı verin.
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("resemble-ai/chatterbox/text-to-speech", { input: { text: "Welcome to ModelRunner. This voice was cloned from a short reference clip. <laugh>", audio_url: "https://media.modelrunner.ai/LgBvbcVQn74cCGHEvWfzT.mp3", exaggeration: 0.25, }, }); ```
