Model Detayları
MiniMax Speech-02 HD, yazılı metni doğal, stüdyo kalitesinde konuşmaya dönüştürür ve barındırılan bir MP3 döndürür. Seslendirilmesini istediğiniz metni verip bir ses seçersiniz; tonlamayı, tempoyu ve telaffuzu model üstlenir, duygu, hız, ses perdesi ve ses seviyesi üzerinde ince kontrol sunar. 30+ dili ve 300+ hazır sesi desteklemesi onu anlatım, seslendirme, IVR/telefon anonsları, sesli kitaplar ve karakter diyalogları için güçlü bir varsayılan tercih haline getirir. HD profili netliği ve sadakati öncelediğinden, insanların baştan sona dinleyeceği içeriklere çok uygundur.
## En uygun olduğu işler - Videolar, açıklayıcı içerikler ve reklamlar için anlatım ve seslendirme - Tutarlı, net bir okuyuşun önemli olduğu sesli kitaplar ve uzun metinler - IVR, telefon menüleri ve otomatik anonslar - Duygu kontrolüyle karakter diyalogları ve canlandırmalı okumalar - Çok dilli içerik — 30+ dilde aynı pipeline
## Şu durumlarda başka bir model seçin - Melodisi ve enstrümantasyonu olan bir müzik parçası gerekiyorsa — bir müzik üretim modeli kullanın - Konuşma yerine genel ses efektleri ya da ortam sesi istiyorsanız — bir text-to-audio ses efekti modeli kullanın - Canlı bir çağrıda gerçek zamanlı, ultra düşük latency gerektiren streaming TTS gerekiyorsa — bu model token stream değil, bitmiş bir dosya döndürür
## İpuçları - Konuşmacıyı seçmek için `voice_setting.voice_id` alanını ayarlayın. Varsayılan `Wise_Woman`; diğer örnekler arasında `Friendly_Person`, `Deep_Voice_Man`, `Calm_Woman`, `Casual_Guy`, `Lively_Girl` ve `Patient_Man` var (300+ ses desteklenir — ses id’sini string olarak verin). - Okuyuşu renklendirmek için `voice_setting.emotion` kullanın (`happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `neutral`); nötr bir okuyuş için boş bırakın. - Tempoyu ve tonu `voice_setting.speed` (0.5–2.0), `voice_setting.pitch` (-12 ile 12 arası) ve `voice_setting.vol` (0.01–10) ile ayarlayın. - Girdi metnini okunmasını istediğiniz gibi noktalayın — virgüller ve noktalar duraklamaları ve tonlamayı belirler.
## Gelişmiş Yapılandırma - `voice_setting.english_normalization` (varsayılan `false`): `true` olduğunda, daha doğal bir telaffuz için sentezden önce İngilizce metni (ör. sayılar ve birimler) normalleştirir; karşılığında küçük bir latency maliyeti olur. API üzerinden ayarlanır. - `language_boost` (varsayılan olarak boş): varsayılan dışı ya da karışık dilli metinlerde tanımayı iyileştirmek için birincil dili/lehçeyi belirtin. Bir dil adı (ör. `English`, `Spanish`, `Japanese`, `Arabic`) ya da `auto` kabul eder.
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("minimax/speech-02-hd", { input: { text: "Welcome to ModelRunner. This is high-definition text to speech.", voice_setting: { voice_id: "Wise_Woman", speed: 1, emotion: "happy" }, }, }); ```
