Ana içeriğe geç
resemble-ai avatarı

Chatterbox HD Voice Conversion API

resemble-ai/chatterboxhd/speech-to-speech

Bir konuşma kaydını sözleri ve okuyuşu koruyarak farklı bir hedef sese dönüştürün — dokuz adlandırılmış HD ses ve daha yüksek sadakat için isteğe bağlı 48kHz upscale ile.

üretilen ses için saniye başına 0.000333

Model girdisi

Input

The speech recording to voice-convert. Its words, timing, and delivery are preserved while the speaker's voice is replaced. Provide a clean, single-speaker clip (WAV or MP3).

The named voice to convert the source recording into. If a reference clip is provided in target_voice_audio_url it overrides this setting; if both are left unset a random target voice is used.

Optional reference clip of the voice to convert the source into. Provide a clean, single-speaker sample of the target voice; it overrides the named target_voice. Leave unset to use the named voice.

Additional Settings

Customize your input with more control.

When true, the generated audio is upscaled to 48kHz for higher quality at the cost of longer generation time. When false, the audio is 24kHz.

You need to be logged in to run this model and view results.
Log in

Model çıktısı

Output

Loading
Generated in 6.446 seconds
Logs (1 lines)

Örnek istekler

Örnekler

Chatterbox HD Voice Conversion API

Chatterbox HD Voice Conversion is a sound AI model by resemble-ai. On ModelRunner it runs through a REST API or via MCP from any AI assistant, at $0.000333 per second of audio.

POST https://queue.modelrunner.run/resemble-ai/chatterboxhd/speech-to-speech

cURL

# Submit a request to the queue. Input fields go at the top level of the
# body. The optional reserved "metadata" object holds your own flat string
# tags — stored on the request, never sent to the model; filter later with
# GET https://queue.modelrunner.run/requests?metadata=<url-encoded JSON>.
curl -X POST https://queue.modelrunner.run/resemble-ai/chatterboxhd/speech-to-speech \
  -H "Authorization: Key $MRUN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "target_voice": "Carl",
    "source_audio_url": "https://media.modelrunner.ai/CyN17SVF8hgwLGA31EK9h.wav",
    "high_quality_audio": false,
    "metadata": {
      "project": "my-project"
    }
  }'
# → { "request_id": "...", "status_url": "...", "response_url": "..." }

# Poll status_url until "COMPLETED", then fetch the result
curl "https://queue.modelrunner.run/resemble-ai/chatterboxhd/speech-to-speech/requests/$REQUEST_ID/status" \
  -H "Authorization: Key $MRUN_API_KEY"
curl "https://queue.modelrunner.run/resemble-ai/chatterboxhd/speech-to-speech/requests/$REQUEST_ID" \
  -H "Authorization: Key $MRUN_API_KEY"

JavaScript

import { modelrunner } from "@modelrunner/client";

const result = await modelrunner.subscribe("resemble-ai/chatterboxhd/speech-to-speech", {
  input: {
    "target_voice": "Carl",
    "source_audio_url": "https://media.modelrunner.ai/CyN17SVF8hgwLGA31EK9h.wav",
    "high_quality_audio": false
  },
});
console.log(result);

Python

import os
import requests

headers = {"Authorization": f"Key {os.environ['MRUN_API_KEY']}"}

submitted = requests.post(
    "https://queue.modelrunner.run/resemble-ai/chatterboxhd/speech-to-speech",
    headers=headers,
    json={
      "target_voice": "Carl",
      "source_audio_url": "https://media.modelrunner.ai/CyN17SVF8hgwLGA31EK9h.wav",
      "high_quality_audio": false
    },
).json()

# Poll submitted["status_url"] until "COMPLETED", then:
result = requests.get(submitted["response_url"], headers=headers).json()

Input parameters

Input parameters of Chatterbox HD Voice Conversion
NameTypeRequiredDescription
source_audio_urlstring (uri)yesThe speech recording to voice-convert. Its words, timing, and delivery are preserved while the speaker's voice is replaced. Provide a clean, single-speaker clip (WAV or MP3).
target_voiceenumnoThe named voice to convert the source recording into. If a reference clip is provided in target_voice_audio_url it overrides this setting; if both are left unset a random target voice is used. One of: Aurora, Blade, Britney, Carl, Cliff, Richard, Rico, Siobhan, Vicky. Default: "Aurora".
target_voice_audio_urlstring (uri)noOptional reference clip of the voice to convert the source into. Provide a clean, single-speaker sample of the target voice; it overrides the named target_voice. Leave unset to use the named voice.
high_quality_audiobooleannoWhen true, the generated audio is upscaled to 48kHz for higher quality at the cost of longer generation time. When false, the audio is 24kHz. Default: false.

Machine-readable: OpenAPI schema · llms.txt

Use Chatterbox HD Voice Conversion from Claude & Cursor (MCP)

Point Claude Code, Claude Desktop, Cursor, or any MCP client at the ModelRunner MCP server and Chatterbox HD Voice Conversion becomes a tool your assistant can call directly — it authorizes via OAuth (no API key in config) and runs this model with the run_model tool using the endpoint resemble-ai/chatterboxhd/speech-to-speech.

MCP client config (Claude Desktop, Cursor)

{
  "mcpServers": {
    "modelrunner": {
      "command": "npx",
      "args": ["-y", "mcp-remote", "https://mcp.modelrunner.run/mcp"]
    }
  }
}

Claude Code

claude mcp add --transport http modelrunner https://mcp.modelrunner.run/mcp

Then ask your assistant, for example: “Run resemble-ai/chatterboxhd/speech-to-speech on ModelRunner to generate sound”. MCP setup guide.

Model Detayları

Model Detayları

Chatterbox HD Voice Conversion, konuşan birinin kaydını alıp farklı bir hedef sesle yeniden seslendirir: özgün sözler, zamanlama ve okuyuş korunur, yalnızca konuşmacının ses tınısı değişir. Dönüştürülecek klibi `source_audio_url` olarak verin, ardından hedef sesi iki yoldan biriyle seçin: `target_voice` ile dokuz hazır adlandırılmış sesten birini (`Aurora`, `Blade`, `Britney`, `Carl`, `Cliff`, `Richard`, `Rico`, `Siobhan`, `Vicky`) seçin ya da herhangi bir sesin kısa ve temiz bir örneğini `target_voice_audio_url` ile verip kaydı tam olarak o sese dönüştürün (ikisi birden ayarlanırsa `target_voice` alanını geçersiz kılar). İkisini de boş bırakırsanız rastgele bir hedef ses kullanılır. Çıktı, barındırılan bir WAV dosyasıdır.

Standart Chatterbox ses dönüştürme kademesinden farkı, özenle seçilmiş dokuz adlandırılmış hedef ses ve daha yüksek sadakattir: `high_quality_audio` alanını `true` yaparsanız sonuç, varsayılan 24kHz yerine 48kHz olarak upscale edilir (üretimi daha yavaş, kalitesi daha yüksek). Metinle değil doğrudan sesle çalıştığı için mevcut anlatımları, diyalogları ya da seslendirmeleri hiçbir şeyi yeniden kaydetmeden yeniden seslendirir. Üretilen ses, Resemble AI’ın algısal filigranını taşır.

## En uygun olduğu işler - Mevcut bir kaydı dokuz hazır HD sesten biriyle yeniden seslendirmek ya da dublajlamak - Kısa bir referans örneğinden yola çıkarak bir kaydı belirli bir sese dönüştürmek - 48kHz çıktı kalitesinin önemli olduğu yüksek sadakatli yeniden seslendirme - Sözleri olduğu gibi bırakıp sesini değiştirerek bir konuşmacıyı anonimleştirmek - Farklı kişilerin kaydettiği anlatımları tek ve tutarlı bir seste birleştirmek

## Şu durumlarda başka bir model seçin - Mevcut bir kaydı dönüştürmek yerine yazılı metinden konuşma üretmek istiyorsanız — `resemble-ai/chatterboxhd/text-to-speech` gibi bir text-to-speech modeli kullanın - Sesi değiştirmek yerine konuşmayı metne dökmeniz gerekiyorsa — bir speech-to-text modeli kullanın - Melodisi ve enstrümantasyonu olan bir müzik parçası istiyorsanız — bir müzik üretim modeli kullanın - Konuşma yerine genel ses efektleri ya da ortam sesi istiyorsanız — bir text-to-audio ses efekti modeli kullanın

## İpuçları - `source_audio_url`, sözleri ve okuyuşu korunacak kayıttır — temiz, tek konuşmacılı bir klip verin (WAV ya da MP3). - Tutarlı ve tekrarlanabilir bir sonuç için `target_voice` alanında dokuz adlandırılmış seçenekten birini seçin; varsayılan değer `Aurora`. - Belirli, özel bir sese dönüştürmek için `target_voice_audio_url` alanına temiz, tek konuşmacılı bir örnek verin — `target_voice` alanını geçersiz kılar. - Sadakat önemliyse ve ek latency sorun değilse 48kHz upscale için `high_quality_audio: true` ayarlayın; daha hızlı ve daha ucuz çalıştırmalar için `false` (24kHz) bırakın.

ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";

const result = await modelrunner.subscribe("resemble-ai/chatterboxhd/speech-to-speech", { input: { source_audio_url: "https://media.modelrunner.ai/RThSDFY174fUmaVkxBj6X.mp3", target_voice: "Aurora", high_quality_audio: true, }, }); ```