Ana içeriğe geç
resemble-ai avatarı

Chatterbox Multilingual TTS API

resemble-ai/chatterbox/text-to-speech/multilingual

Metni 23 dilde doğal bir konuşmaya dönüştürün — dil seçici ve duygu yoğunluğu kontrolüyle.

üretilen ses için saniye başına 0.000375

Model girdisi

Input

The text to synthesize into speech (maximum 300 characters). Supports 23 languages including English, French, German, Spanish, Italian, Portuguese, Hindi, Arabic, Chinese, Japanese, Korean, and more.

Language for speech synthesis. Select the language that matches your text so pronunciation and prosody are correct.

Additional Settings

Customize your input with more control.

Min: 0.25 - Max: 2

Controls speech expressiveness and emotional intensity (0.25-2.0). 0.5 is neutral, higher values increase expressiveness. Extreme values may be unstable.

Min: 0.05 - Max: 5

Controls randomness and variation in generation (0.05-5.0). Higher values create more varied speech patterns.

Min: 0 - Max: 1

Configuration/pace weight controlling generation guidance (0.0-1.0). Use 0.0 for language transfer to mitigate accent inheritance.

Random seed for reproducible results. Set to 0 for random generation, or provide a specific number for consistent outputs.

You need to be logged in to run this model and view results.
Log in

Model çıktısı

Output

Loading
Generated in 8.213 seconds
Logs (1 lines)

Örnek istekler

Örnekler

Chatterbox Multilingual TTS API

Chatterbox Multilingual TTS is a sound AI model by resemble-ai. On ModelRunner it runs through a REST API or via MCP from any AI assistant, at $0.000375 per second of audio.

POST https://queue.modelrunner.run/resemble-ai/chatterbox/text-to-speech/multilingual

cURL

# Submit a request to the queue. Input fields go at the top level of the
# body. The optional reserved "metadata" object holds your own flat string
# tags — stored on the request, never sent to the model; filter later with
# GET https://queue.modelrunner.run/requests?metadata=<url-encoded JSON>.
curl -X POST https://queue.modelrunner.run/resemble-ai/chatterbox/text-to-speech/multilingual \
  -H "Authorization: Key $MRUN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Hola y bienvenido. Genera voces naturales y expresivas en veintitrés idiomas, listas para tus vídeos y aplicaciones.",
    "voice": "spanish",
    "prompt": "Hola y bienvenido. Genera voces naturales y expresivas en veintitrés idiomas, listas para tus vídeos y aplicaciones.",
    "cfg_scale": 0.5,
    "temperature": 0.8,
    "exaggeration": 0.5,
    "metadata": {
      "project": "my-project"
    }
  }'
# → { "request_id": "...", "status_url": "...", "response_url": "..." }

# Poll status_url until "COMPLETED", then fetch the result
curl "https://queue.modelrunner.run/resemble-ai/chatterbox/text-to-speech/multilingual/requests/$REQUEST_ID/status" \
  -H "Authorization: Key $MRUN_API_KEY"
curl "https://queue.modelrunner.run/resemble-ai/chatterbox/text-to-speech/multilingual/requests/$REQUEST_ID" \
  -H "Authorization: Key $MRUN_API_KEY"

JavaScript

import { modelrunner } from "@modelrunner/client";

const result = await modelrunner.subscribe("resemble-ai/chatterbox/text-to-speech/multilingual", {
  input: {
    "text": "Hola y bienvenido. Genera voces naturales y expresivas en veintitrés idiomas, listas para tus vídeos y aplicaciones.",
    "voice": "spanish",
    "prompt": "Hola y bienvenido. Genera voces naturales y expresivas en veintitrés idiomas, listas para tus vídeos y aplicaciones.",
    "cfg_scale": 0.5,
    "temperature": 0.8,
    "exaggeration": 0.5
  },
});
console.log(result);

Python

import os
import requests

headers = {"Authorization": f"Key {os.environ['MRUN_API_KEY']}"}

submitted = requests.post(
    "https://queue.modelrunner.run/resemble-ai/chatterbox/text-to-speech/multilingual",
    headers=headers,
    json={
      "text": "Hola y bienvenido. Genera voces naturales y expresivas en veintitrés idiomas, listas para tus vídeos y aplicaciones.",
      "voice": "spanish",
      "prompt": "Hola y bienvenido. Genera voces naturales y expresivas en veintitrés idiomas, listas para tus vídeos y aplicaciones.",
      "cfg_scale": 0.5,
      "temperature": 0.8,
      "exaggeration": 0.5
    },
).json()

# Poll submitted["status_url"] until "COMPLETED", then:
result = requests.get(submitted["response_url"], headers=headers).json()

Input parameters

Input parameters of Chatterbox Multilingual TTS
NameTypeRequiredDescription
textstringyesThe text to synthesize into speech (maximum 300 characters). Supports 23 languages including English, French, German, Spanish, Italian, Portuguese, Hindi, Arabic, Chinese, Japanese, Korean, and more.
voiceenumnoLanguage for speech synthesis. Select the language that matches your text so pronunciation and prosody are correct. One of: english, arabic, danish, german, greek, spanish, finnish, french, hebrew, hindi, italian, japanese, korean, malay, dutch, norwegian, polish, portuguese, russian, swedish, swahili, turkish, chinese. Default: "english".
exaggerationnumbernoControls speech expressiveness and emotional intensity (0.25-2.0). 0.5 is neutral, higher values increase expressiveness. Extreme values may be unstable. Default: 0.5.
temperaturenumbernoControls randomness and variation in generation (0.05-5.0). Higher values create more varied speech patterns. Default: 0.8.
cfg_scalenumbernoConfiguration/pace weight controlling generation guidance (0.0-1.0). Use 0.0 for language transfer to mitigate accent inheritance. Default: 0.5.
seedintegernoRandom seed for reproducible results. Set to 0 for random generation, or provide a specific number for consistent outputs.

Machine-readable: OpenAPI schema · llms.txt

Use Chatterbox Multilingual TTS from Claude & Cursor (MCP)

Point Claude Code, Claude Desktop, Cursor, or any MCP client at the ModelRunner MCP server and Chatterbox Multilingual TTS becomes a tool your assistant can call directly — it authorizes via OAuth (no API key in config) and runs this model with the run_model tool using the endpoint resemble-ai/chatterbox/text-to-speech/multilingual.

MCP client config (Claude Desktop, Cursor)

{
  "mcpServers": {
    "modelrunner": {
      "command": "npx",
      "args": ["-y", "mcp-remote", "https://mcp.modelrunner.run/mcp"]
    }
  }
}

Claude Code

claude mcp add --transport http modelrunner https://mcp.modelrunner.run/mcp

Then ask your assistant, for example: “Run resemble-ai/chatterbox/text-to-speech/multilingual on ModelRunner to generate sound”. MCP setup guide.

Model Detayları

Model Detayları

Chatterbox Multilingual, yazılı metni 23 dilde doğal ve ifadeli bir konuşmaya dönüştürür ve barındırılan bir WAV dosyası döndürür. `voice` seçicisiyle bir dil belirleyin; metninizi o dilde doğru telaffuz ve prozodiyle seslendirsin. Desteklenen diller arasında İngilizce, Fransızca, Almanca, İspanyolca, İtalyanca, Portekizce, Hintçe, Arapça, Çince, Japonca, Korece ve daha fazlası var. `exaggeration` kontrolü duygu yoğunluğunu artırıp azaltır, `temperature` kontrolü de prozodiyi çeşitlendirir; böylece okumalar düz ve nötr de olabilir, canlı ve ifadeli de. Girdi çağrı başına 300 karakterle sınırlıdır; bu da modeli uzun belgelerden çok kısa replikler, anonslar, bildirimler ve klip uzunluğundaki anlatımlar için uygun kılar.

## En uygun olduğu işler - İngilizce dışındaki belirli bir dilde konuşma üretmek (Fransızca, İspanyolca, Almanca, Portekizce, İtalyanca, Hintçe, Arapça, Çince, Japonca, Korece ve daha fazlası) - Uygulamalar, oyunlar, agent’lar ve bildirimler için kısa, çok dilli ses replikleri - Dilin senaryoyla örtüşmesi gereken klipler ve sosyal medya içerikleri için yerelleştirilmiş seslendirme - Duygu yoğunluğunu her dilde ayrı ayrı ayarlamak istediğiniz ifadeli okumalar

## Şu durumlarda başka bir model seçin - İngilizce için kendi referans kaydınızdan zero-shot ses klonlama istiyorsanız — ayrı bir referans ses girdisi sunan İngilizce kardeş modeli `resemble-ai/chatterbox/text-to-speech` kullanın - Uzun metinleri tek çağrıda seslendirmeniz gerekiyorsa — bu endpoint girdiyi 300 karakterle sınırlar; uzun metni bölün ya da uzun metinlere yönelik bir TTS modeli kullanın - Dil seçici yerine adlandırılmış, hazır seslerden oluşan geniş bir kütüphane istiyorsanız — hazır ses kataloğu sunan bir TTS modeli kullanın - Konuşma yerine müzik, ses efekti ya da ortam sesi gerekiyorsa — bir müzik ya da ses üretim modeli kullanın - Konuşma üretmek yerine konuşmayı metne dökmeniz gerekiyorsa — bir speech-to-text modeli kullanın

## İpuçları - Telaffuzun doğru olması için `voice` değerini `text` alanındaki metnin diline göre ayarlayın; dil ile metin uyuşmazsa kalite düşer. - Her çağrıyı 300 karakter sınırı içinde tutun; uzun senaryoları cümle boyutunda parçalara bölüp sesleri birleştirin. - Daha dramatik ve duygusal bir okuyuş için `exaggeration` değerini yükseltin; sakin ve ölçülü okumalar için 0.5 varsayılanına yakın tutun. - Girdinizi okunmasını istediğiniz gibi noktalayın — virgüller ve noktalar duraklamaları ve tonlamayı belirler.

## Gelişmiş Yapılandırma - `temperature` (0.05-5.0, varsayılan 0.8): sampling temperature. Düşük değerler daha istikrarlı ve öngörülebilir sonuç verir; yüksek değerler prozodiye ve okuyuşa çeşitlilik katar. - `cfg_scale` (0.0-1.0, varsayılan 0.5): guidance/tempo ağırlığı. Yüksek değerler prompt’u daha yakından izler; diller arası aktarımı daha temiz hale getirip aksan taşınmasını azaltmak için 0.0 yapın. - `seed` (0 = rastgele): bir üretimi tekrarlanabilir kılmak için sabit bir tam sayı verin.

ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";

const result = await modelrunner.subscribe("resemble-ai/chatterbox/text-to-speech/multilingual", { input: { text: "Bonjour et bienvenue sur ModelRunner. Cette voix a ete generee en francais.", voice: "french", exaggeration: 0.5, }, }); ```