Ana içeriğe geç
hexgrad avatarı

Kokoro-82M API

hexgrad/kokoro-82m

Metni 6 dilde 46 sesle doğal bir konuşmaya dönüştürün — işlem süresi üzerinden faturalandırılır, klip başına bir sentin küçük bir kesri.

A4000,RTX4000
0.00008567

Model girdisi

Input

Text to synthesize into speech. Long text is automatically split and synthesized in sequence.

Speaker voice. 46 voices across 6 languages, selected by one field: American and British English, French, Hindi, Italian, Japanese, and Mandarin Chinese. The two-letter prefix encodes language and gender (af_/am_ American English, bf_/bm_ British English, ff_ French, hf_/hm_ Hindi, if_/im_ Italian, jf_/jm_ Japanese, zf_/zm_ Mandarin Chinese; f = female, m = male). Pick a voice whose language matches your text.

Additional Settings

Customize your input with more control.

Min: 0.1 - Max: 5

Speech speed multiplier (0.5 = half speed, 2.0 = double speed).

You need to be logged in to run this model and view results.
Log in

Model çıktısı

Output

Loading
Generated in 0.259 seconds
Logs (1 lines)

Örnek istekler

Örnekler

Kokoro-82M API

Kokoro-82M is a sound AI model by hexgrad. On ModelRunner it runs through a REST API or via MCP from any AI assistant, at about $0.00008567 per audio clip.

POST https://queue.modelrunner.run/hexgrad/kokoro-82m

cURL

# Submit a request to the queue. Input fields go at the top level of the
# body. The optional reserved "metadata" object holds your own flat string
# tags — stored on the request, never sent to the model; filter later with
# GET https://queue.modelrunner.run/requests?metadata=<url-encoded JSON>.
curl -X POST https://queue.modelrunner.run/hexgrad/kokoro-82m \
  -H "Authorization: Key $MRUN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Bienvenue dans notre nouvelle collection, conçue pour sublimer chaque instant de votre quotidien.",
    "speed": 1,
    "voice": "ff_siwis",
    "metadata": {
      "project": "my-project"
    }
  }'
# → { "request_id": "...", "status_url": "...", "response_url": "..." }

# Poll status_url until "COMPLETED", then fetch the result
curl "https://queue.modelrunner.run/hexgrad/kokoro-82m/requests/$REQUEST_ID/status" \
  -H "Authorization: Key $MRUN_API_KEY"
curl "https://queue.modelrunner.run/hexgrad/kokoro-82m/requests/$REQUEST_ID" \
  -H "Authorization: Key $MRUN_API_KEY"

JavaScript

import { modelrunner } from "@modelrunner/client";

const result = await modelrunner.subscribe("hexgrad/kokoro-82m", {
  input: {
    "text": "Bienvenue dans notre nouvelle collection, conçue pour sublimer chaque instant de votre quotidien.",
    "speed": 1,
    "voice": "ff_siwis"
  },
});
console.log(result);

Python

import os
import requests

headers = {"Authorization": f"Key {os.environ['MRUN_API_KEY']}"}

submitted = requests.post(
    "https://queue.modelrunner.run/hexgrad/kokoro-82m",
    headers=headers,
    json={
      "text": "Bienvenue dans notre nouvelle collection, conçue pour sublimer chaque instant de votre quotidien.",
      "speed": 1,
      "voice": "ff_siwis"
    },
).json()

# Poll submitted["status_url"] until "COMPLETED", then:
result = requests.get(submitted["response_url"], headers=headers).json()

Input parameters

Input parameters of Kokoro-82M
NameTypeRequiredDescription
textstringyesText to synthesize into speech. Long text is automatically split and synthesized in sequence.
voiceenumnoSpeaker voice. 46 voices across 6 languages, selected by one field: American and British English, French, Hindi, Italian, Japanese, and Mandarin Chinese. The two-letter prefix encodes language and gender (af_/am_ American English, bf_/bm_ British English, ff_ French, hf_/hm_ Hindi, if_/im_ Italian, jf_/jm_ Japanese, zf_/zm_ Mandarin Chinese; f = female, m = male). Pick a voice whose language matches your text. One of: af_alloy, af_aoede, af_bella, af_jessica, af_kore, af_nicole, af_nova, af_river, af_sarah, af_sky, am_adam, am_echo, am_eric, am_fenrir, am_liam, am_michael, am_onyx, am_puck, bf_alice, bf_emma, bf_isabella, bf_lily, bm_daniel, bm_fable, bm_george, bm_lewis, ff_siwis, hf_alpha, hf_beta, hm_omega, hm_psi, if_sara, im_nicola, jf_alpha, jf_gongitsune, jf_nezumi, jf_tebukuro, jm_kumo, zf_xiaobei, zf_xiaoni, zf_xiaoxiao, zf_xiaoyi, zm_yunjian, zm_yunxi, zm_yunxia, zm_yunyang. Default: "af_bella".
speednumbernoSpeech speed multiplier (0.5 = half speed, 2.0 = double speed). Default: 1.

Machine-readable: OpenAPI schema · llms.txt

Use Kokoro-82M from Claude & Cursor (MCP)

Point Claude Code, Claude Desktop, Cursor, or any MCP client at the ModelRunner MCP server and Kokoro-82M becomes a tool your assistant can call directly — it authorizes via OAuth (no API key in config) and runs this model with the run_model tool using the endpoint hexgrad/kokoro-82m.

MCP client config (Claude Desktop, Cursor)

{
  "mcpServers": {
    "modelrunner": {
      "command": "npx",
      "args": ["-y", "mcp-remote", "https://mcp.modelrunner.run/mcp"]
    }
  }
}

Claude Code

claude mcp add --transport http modelrunner https://mcp.modelrunner.run/mcp

Then ask your assistant, for example: “Run hexgrad/kokoro-82m on ModelRunner to generate sound”. MCP setup guide.

Model Detayları

Model Detayları

Kokoro-82M, yazılı metni doğal bir konuşmaya dönüştürüp barındırılan bir WAV dosyası döndüren, açık ağırlıklı ve kompakt bir text-to-speech modelidir. Öne çıkan yanı, fiyatına göre kapsamı: tek bir endpoint, 6 dilde 46 adlandırılmış sesi konuşur — Amerikan ve Britanya İngilizcesi, Fransızca, Hintçe, İtalyanca, Japonca ve Mandarin Çincesi — hepsi tek bir `voice` alanıyla seçilir; dil başına ayrı model de, klonlanacak bir referans kayıt da gerekmez. Yalnızca 82 milyon parametreyle hızlı çalışır ve işlem süresi üzerinden faturalandırılır; böylece tipik bir replik bir sentin küçük bir kesri kadar tutar, karakter başına fiyatlandıran konuşma servislerinin epey altında. Uzun metin kendiliğinden bölünüp seslendirilir ve konuşma hızını ayarlayabilirsiniz.

## En uygun olduğu işler - Videolar, demolar ve uygulama prototipleri için ucuz ve hızlı seslendirme ve anlatım - İngilizce, Fransızca, Hintçe, İtalyanca, Japonca ve Çince için tek bir endpoint’ten çok dilli text-to-speech - Metnin bölünüp sırayla okunduğu sesli kitaplar ya da makaleler için uzun metin anlatımı - Eğitim ya da referans klip olmadan 46 adlandırılmış ses arasından seçim yapmak - Klip başına maliyetin önemli olduğu yüksek hacimli konuşma üretimi

## Şu durumlarda başka bir model seçin - Belirli bir kişinin sesini bir örnekten klonlamanız gerekiyorsa — bu modelin sabit bir ses bankası var ve referans ses girdisi yok; `resemble-ai/chatterbox/text-to-speech` gibi ses klonlayan bir TTS modeli kullanın - SSML, duygu etiketleri ya da ince duygu kontrolü gerekiyorsa — bu endpoint yalnızca düz metin alır; ifadeli, kontrol edilebilir bir TTS modeli kullanın - İngilizce dışında bir dilde geniş ses seçeneği gerekiyorsa (burada Fransızca ve İtalyanca için yalnızca bir ya da iki ses var) — daha geniş kapsamlı, özel bir çok dilli TTS kullanın

## İpuçları - Sesi metninizin diline eşleyin: doğru telaffuz için Fransızca yazıp İngilizce bir ses yerine `ff_siwis` seçin - Ön ekteki harf cinsiyeti de belirler — `*f_` sesleri kadın, `*m_` sesleri erkektir - `text` alanına tam paragraflar verin; uzun girdi kendiliğinden bölünüp seslendirilir - Tempoyu ayarlamak için `speed` kullanın (0.1–5, varsayılan 1); en doğal okuyuş için 1’e yakın tutun

ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";

const result = await modelrunner.subscribe("hexgrad/kokoro-82m", { input: { text: "Bonjour, ceci est un test de synthèse vocale.", voice: "ff_siwis", speed: 1, }, }); ```