Model Detayları
Stable Audio 2.5 Audio-to-Audio, verdiğiniz bir kaynak ses klibini metin açıklamasının yönlendirmesiyle yeni bir klibe dönüştürür. `audio_url` ile bir parça yükleyin, istediğiniz sesi `prompt` alanında tarif edin ("bunu zengin, sinematik bir orkestra aranjmanına dönüştür", "enerjik bir elektronik dans parçasına remix’le", "plak cızırtılı bir lofi hip-hop beat’i olarak yeniden yorumla"); model size yepyeni bir WAV klibi döndürür. Orijinalden ne kadar uzaklaşacağını `strength` ile ayarlayın — düşük değerler kaynağa yakın kalır, yüksek değerler prompt’u daha serbestçe izler. Text-to-audio sürümüyle aynı, lisanslı veriyle eğitilmiş ve ticari kullanım açısından güvenli Stable Audio 2.5 modeli üzerine kuruludur: hem müzik hem de ses efektleriyle çalışır ve yaklaşık 190 saniyeye kadar klip üretebilir.
## En uygun olduğu işler - Mevcut bir parçayı yeniden tarzlamak ya da enstrümantasyonunu değiştirmek (folk gitar → orkestra, akustik → elektronik) - Kaba bir müzikal fikri ya da mırıldanılmış bir melodiyi daha dolgun bir aranjmana dönüştürmek - Kaynağın yapısını koruyarak ortam seslerini ya da ses efektlerini yeni bir tarzda yeniden yorumlamak - A/B seçenekleri için bir referans klibin prompt’la yönlendirilen varyasyonlarını üretmek - Lisanslı veriyle eğitilmiş bir modelin önem taşıdığı, ticari açıdan güvenli ses işleri
## Şu durumlarda başka bir model seçin - Kaynak klip olmadan metinden ses üretmek istiyorsanız — Stable Audio 2.5 text-to-audio modelini kullanın - Sözleri koruyarak konuşan kişinin sesini değiştirmek istiyorsanız — bir speech-to-speech / ses dönüştürme modeli kullanın - Belirli bir seste temiz bir anlatım gerekiyorsa — bir text-to-speech modeli kullanın - Yalnızca mevcut bir kaydın gürültüsünü gidermeniz ya da içinden bir sesi ayırmanız gerekiyorsa — bir ses temizleme / izolasyon modeli kullanın
## İpuçları - `strength` (0.01–1, varsayılan 0.8) en önemli ayardır: ~0.3–0.5 kaynağı tanınır halde bırakır, ~0.8–1.0 prompt’a ağırlık verir - `total_seconds` (1–190) çıktı uzunluğunu belirler; kaynak klibin süresine uymak için boş bırakın - Müzikal dönüşümlerde prompt’ta türü, enstrümantasyonu, ruh halini ve tempoyu tarif edin - Kaliteyi biraz artırmak için `num_inference_steps` değerini yükseltin (en fazla 8); prompt’a daha sıkı uyum için `guidance_scale` değerini yükseltin - Kabul edilen kaynak formatları: mp3, ogg, wav, m4a, aac
## Sınırlamalar - Her çağrı tek bir WAV klibi döndürür; multitrack çıktı ya da stem ayırma yoktur - Çok yüksek `strength` değeri kaynağı fiilen yok sayar ve text-to-audio üretimi gibi davranır
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("stability-ai/stable-audio-2.5/audio-to-audio", { input: { prompt: "transform into a lush cinematic orchestral arrangement with sweeping strings", audio_url: "https://example.com/source-guitar.wav", strength: 0.7, }, }); ```
