Model Detayları
Kokoro-82M, yazılı metni doğal bir konuşmaya dönüştürüp barındırılan bir WAV dosyası döndüren, açık ağırlıklı ve kompakt bir text-to-speech modelidir. Öne çıkan yanı, fiyatına göre kapsamı: tek bir endpoint, 6 dilde 46 adlandırılmış sesi konuşur — Amerikan ve Britanya İngilizcesi, Fransızca, Hintçe, İtalyanca, Japonca ve Mandarin Çincesi — hepsi tek bir `voice` alanıyla seçilir; dil başına ayrı model de, klonlanacak bir referans kayıt da gerekmez. Yalnızca 82 milyon parametreyle hızlı çalışır ve işlem süresi üzerinden faturalandırılır; böylece tipik bir replik bir sentin küçük bir kesri kadar tutar, karakter başına fiyatlandıran konuşma servislerinin epey altında. Uzun metin kendiliğinden bölünüp seslendirilir ve konuşma hızını ayarlayabilirsiniz.
## En uygun olduğu işler - Videolar, demolar ve uygulama prototipleri için ucuz ve hızlı seslendirme ve anlatım - İngilizce, Fransızca, Hintçe, İtalyanca, Japonca ve Çince için tek bir endpoint’ten çok dilli text-to-speech - Metnin bölünüp sırayla okunduğu sesli kitaplar ya da makaleler için uzun metin anlatımı - Eğitim ya da referans klip olmadan 46 adlandırılmış ses arasından seçim yapmak - Klip başına maliyetin önemli olduğu yüksek hacimli konuşma üretimi
## Şu durumlarda başka bir model seçin - Belirli bir kişinin sesini bir örnekten klonlamanız gerekiyorsa — bu modelin sabit bir ses bankası var ve referans ses girdisi yok; `resemble-ai/chatterbox/text-to-speech` gibi ses klonlayan bir TTS modeli kullanın - SSML, duygu etiketleri ya da ince duygu kontrolü gerekiyorsa — bu endpoint yalnızca düz metin alır; ifadeli, kontrol edilebilir bir TTS modeli kullanın - İngilizce dışında bir dilde geniş ses seçeneği gerekiyorsa (burada Fransızca ve İtalyanca için yalnızca bir ya da iki ses var) — daha geniş kapsamlı, özel bir çok dilli TTS kullanın
## İpuçları - Sesi metninizin diline eşleyin: doğru telaffuz için Fransızca yazıp İngilizce bir ses yerine `ff_siwis` seçin - Ön ekteki harf cinsiyeti de belirler — `*f_` sesleri kadın, `*m_` sesleri erkektir - `text` alanına tam paragraflar verin; uzun girdi kendiliğinden bölünüp seslendirilir - Tempoyu ayarlamak için `speed` kullanın (0.1–5, varsayılan 1); en doğal okuyuş için 1’e yakın tutun
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("hexgrad/kokoro-82m", { input: { text: "Bonjour, ceci est un test de synthèse vocale.", voice: "ff_siwis", speed: 1, }, }); ```
