Model Detayları
Demucs, mikslenmiş bir müzik kaydını iki hazır ses dosyasına ayırır: vokali çıkarılmış enstrümantal ve izole edilmiş vokalin kendisi. Tek bir ses dosyası gönderin; ikisi de tam uzunlukta ve 44.1 kHz olarak döner. Decode işini ffmpeg üstlendiği için wav, mp3, flac ve ogg dosyalarının hepsi çalışır. Altta Hybrid Transformer Demucs (`htdemucs`) çalışır; bu ağ, özellikle müzik kaynak ayrıştırması için MusDB ve buna ek 800 şarkıyla eğitilmiştir. Prompt yoktur: ayrım sabittir, bu da sonucu bütün bir katalog boyunca öngörülebilir kılar.
## En uygun olduğu işler - Bir şarkıdan ana vokali çıkararak karaoke ya da altyapı parçası hazırlamak - Remix ya da sample için bitmiş bir miksten a cappella vokali çekip almak - Mashup, cover ya da DJ edit için vokal ve enstrümantal stem’leri hazırlamak - Bir müzik kütüphanesini toplu işleyip vokal/enstrümantal çiftlerine ayırmak - Transkripsiyon ya da şarkı sözü hizalaması için temiz bir vokal elde etmek
## Şu durumlarda başka bir model seçin - Adıyla belirttiğiniz tek bir enstrümanı ya da sözcüklerle tarif edebileceğiniz herhangi bir sesi istiyorsanız — `meta/sam-audio/separate` bir metin prompt’u alır ve adını verdiğiniz sesi izole eder. - Müziği ayırmak yerine bir konuşma kaydını temizlemek istiyorsanız — `rikorose/deepfilternet3` ve `elevenlabs/audio-isolation` ayrım yapmaz, bunun yerine gürültüyü giderir. - Davulu, bası ve geri kalan partileri ayrı dosyalar olarak almanız gerekiyorsa — bu endpoint yalnızca vokali ve onun dışındaki her şeyi döndürür.
## İpuçları - Çıktı, her zaman aynı sırada gelen iki URL’den oluşan bir dizidir: 0. indeks enstrümantal, 1. indeks izole vokaldir. - Vokalin makul ölçüde duyulduğu tam bantlı bir miks verin — tek başına bir vokalde ya da enstrümantal bir parçada ayrılacak bir şey yoktur. - Faturalandırma işlem süresinin saniyesi üzerindendir ve bu süre parçanın uzunluğuyla artar: 30 saniyelik bir klip yaklaşık 4.5 saniye sürdü. - Bir sonuç sizi tatmin etmedikçe `model` değerini `htdemucs` bırakın: `htdemucs_ft` "biraz daha iyi olabilir", ancak dört kat uzun sürer ve yaklaşık dört kat pahalıdır. - `shifts` değerini yalnızca bir ayrım kararsız duyuluyorsa yükseltin: her ek shift, ayrımı bir kez daha çalıştırıp geçişlerin ortalamasını alır; süre ve fiyat da buna göre katlanır.
## Gelişmiş Yapılandırma - `model` ayrıştırma ağını seçer; her değer aynı vokal/enstrümantal çiftini döndürür, yani yalnızca kaliteyle süre ve maliyet arasında bir denge kurar. - `clip_mode`, seviyesi full scale’i aşan bir parçanın nasıl ele alınacağını belirler: `rescale` (varsayılan) sinyalin tamamını ölçekleyerek düşürür, `clamp` sinyali sert biçimde kırpar (hard clipping), `none` ise sinyale dokunmaz.
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("meta/demucs", { input: { audio: "https://media.modelrunner.ai/PlbJ07n9klVvKGysT4qdy.wav", model: "htdemucs", output_format: "mp3", }, }); // result.output[0] -> instrumental, result.output[1] -> isolated vocal ```
