Model Detayları
SAM Audio (Separate), metinle yönlendirilen ses kaynağı ayrıştırması yapar: miks bir kayıt ve istediğiniz sesi anlatan kısa, doğal dilde bir açıklama verirsiniz; model o sesi ayrı bir parça olarak izole eder. Hedefi nasıl söylüyorsanız öyle tarif edin — "köpek havlaması", "ana vokal", "konuşma", "yağmur", "elektro gitar" — model de izole edilmiş hedefi barındırılan bir ses dosyası olarak döndürür. Güçlü yanı open-vocabulary hedeflemedir: sabit bir stem listesiyle sınırlı değilsiniz, bu yüzden insan seslerinde, enstrümanlarda, çevre seslerinde ve efektlerde aynı şekilde çalışır. Model ayrıca geri kalan sesi (hedef dışındaki her şeyi) de hesaplar, ancak bu endpoint sonuç olarak izole edilmiş hedef parçayı döndürür.
## En uygun olduğu işler - Gürültülü ya da katmanlı bir miksten tek bir insan sesini, enstrümanı ya da ses efektini çekip almak - Hazır bir stem yerine sözcüklerle tarif edilen herhangi bir sesi izole etmek (ör. "havlayan bir köpek", "kalabalık alkışı") - Yalnızca ilgilendiğiniz sesi çıkararak saha kayıtlarını, podcast’leri ve röportajları temizlemek - Tek bir öğenin ayrı olarak gerektiği düzenleme, sampling ya da erişilebilirlik işleri için kaydı hazırlamak
## Şu durumlarda başka bir model seçin - Yalnızca arka plandaki gürültüyü ya da müziği temizleyip net bir konuşma elde etmeniz gerekiyorsa — özel bir ses izolasyonu modeli daha basittir - Tarif edilen tek bir hedef yerine sabit bir çoklu stem ayrımının (vokal/davul/bas/diğer) tek seferde döndürülmesini istiyorsanız - Mevcut bir kaydı ayrıştırmak yerine ses üretmeniz ya da dönüştürmeniz gerekiyorsa — bir text-to-audio ya da audio-to-audio sentez modeli kullanın
## İpuçları - `prompt` alanını kısa ve somut tutun; sesi, birine anlatırken kullanacağınız sözcüklerle adlandırın - `audio_url` için WAV, MP3 ya da FLAC dosyası verin - `acceleration` hız ile kalite arasında denge kurar (`fast`, `balanced`, `quality`); varsayılan `balanced` iyi bir başlangıç noktasıdır - `reranking_candidates` kaliteyi artırmak için birden fazla ayrıştırma üretip bunları sıralar — 1’in üzerindeki değerlerde her ek aday için ayrıca ücret alındığını unutmayın - Uzun dosyalarda `max_chunk_duration` ve `chunk_overlap`, sesin geçişler boyunca nasıl bölüneceğini ve crossfade ile nasıl birleştirileceğini belirler
## Sınırlamalar - Yoğun biçimde üst üste binen ya da spektral olarak benzer sesler, hedef ile geri kalan ses arasında birbirine sızabilir - Endpoint yalnızca izole edilmiş hedefi döndürür; geri kalan ses hesaplanır ama sonuç olarak döndürülmez
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("meta/sam-audio/separate", { input: { audio_url: "https://media.modelrunner.ai/JbyO9TzNupSFoqNrlmaWe.mp3", prompt: "dog barking", acceleration: "balanced", }, }); ```
