Model Detayları
Stable Audio 2.5, yazılı bir açıklamayı yaklaşık 190 saniyeye kadar süren, bitmiş bir ses klibine dönüştürür — bir müzik parçası, bir ses atmosferi, ortam sesi ya da bir ses efekti — ve sonucu WAV dosyası olarak döndürür. İstediğinizi `prompt` alanına yazın ("driving synthwave with a punchy kick and arpeggiated bass", "gentle rain on a window with distant thunder", "upbeat corporate acoustic bed, no vocals"), uzunluğu da `seconds_total` ile belirleyin. En güçlü yanı uzun soluklu üretimdir: birkaç saniyeyle sınırlı kısa ses efekti modellerinin aksine tek bir çağrı, tam bir fon müziği olarak kullanılabilecek dakikalarca süren parçalar üretebilir. Ayrıca ticari kullanım açısından güvenli çıktı için tamamen lisanslı bir veri setiyle eğitilmiştir.
## En uygun olduğu işler - Videolar, reklamlar, podcast’ler ve oyunlar için fon müziği ve enstrümantal altyapılar - Tek bir metin prompt’undan yaklaşık üç dakikaya kadar uzun soluklu parçalar ve loop’lar - Sahneler için ortam sesleri ve ses atmosferleri (yağmur, kafe uğultusu, orman, oda tonu) - Düz bir dille tarif edilen tek seferlik ses efektleri ve foley - Ticari açıdan güvenli, lisanslı veriyle eğitilmiş bir modelin önem taşıdığı, telif konusunda hassas ses işleri
## Şu durumlarda başka bir model seçin - Metinden üretmek yerine mevcut bir ses klibini dönüştürmek ya da yeniden tarzlamak istiyorsanız — bir audio-to-audio modeli kullanın - Doğal bir konuşma anlatımı ya da belirli bir seslendirme sesi gerekiyorsa — bir text-to-speech modeli kullanın - Yalnızca çok kısa, tek seferlik bir efekt gerekiyorsa ve minik kliplerde saniye başına faturalandırma istiyorsanız — saniye başına ücretlendirilen bir ses efekti modeli daha ucuza gelebilir
## İpuçları - `seconds_total` 1–190 saniye arasında değer alır; faturalandırma üretim başına sabit ücretle yapılır, yani uzun klipler kısalarla aynı fiyata gelir - Müzik için prompt’ta türü, enstrümantasyonu, ruh halini ve tempoyu; ses efektleri için sesin kaynağını, ortamı ve malzemeleri tarif edin - Temiz bir fon müziği istediğinizde prompt’a "no vocals" ya da "instrumental" yazın - Kaliteyi biraz artırmak için `num_inference_steps` değerini yükseltin (en fazla 8); prompt’a daha sıkı uyum için `guidance_scale` değerini yükseltin
## Sınırlamalar - Her çağrı tek bir WAV klibi döndürür; multitrack çıktı ya da stem ayırma yoktur - Çok kısa süreler, uzun kliplere göre müzikal açıdan daha az gelişmiş sonuçlar verebilir
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("stability-ai/stable-audio-2.5/text-to-audio", { input: { prompt: "upbeat lofi hip hop instrumental with a warm vinyl texture", seconds_total: 60, }, }); ```
