Model Detayları
ElevenLabs Scribe v1, konuşma içeren ses dosyalarını doğru bir yazılı metne dönüştürür. Bir ses kaydının URL’sini verin (mp3, wav, m4a, ogg ya da aac); model tam transkripti düz bir string olarak döndürür; doğruluğu 99 dilde sınıfının en iyisidir. Konuşulan dili otomatik algılar, kimin konuştuğunu etiketleyebilir (diarization) ve kahkaha, alkış gibi konuşma dışı ses olaylarını işaretler — bu da onu kayıtları kullanılabilir, aranabilir metne dönüştürmek için güçlü bir varsayılan yapar.
## En uygun olduğu işler - Toplantıları, röportajları, podcast’leri ve sesli notları yazıya dökmek - Kaynak sesten güvenilir kelime sınırlarıyla altyazı ve kapalı altyazı üretmek - Konuşulan dilin bilinmediği ya da karışık olduğu çok dilli transkripsiyon (99 dil, otomatik algılanır) - Diarization ile çok kişili konuşmaların konuşmacıya atfedilmiş transkriptleri - Konuşma kayıtlarından aranabilir arşivler ya da sonrasında çalışacak NLP pipeline’ları kurmak
## Şu durumlarda başka bir model seçin - Yazıya dökmek yerine metinden konuşma üretmek istiyorsanız — bir text-to-speech modeli kullanın - Sesi başka bir dilin metnine çevirmeniz gerekiyorsa — bu model konuşulan dilde yazıya döker, bir konuşma çevirmeni değildir - Devam eden bir görüşmenin canlı, streaming transkripsiyonu gerekiyorsa — bu model yüklenmiş tam bir dosyayı işler ve bitmiş bir transkript döndürür
## İpuçları - Konuşulan dilin otomatik algılanması için `language_code` alanını boş bırakın; dili zaten biliyorsanız ve algılamayı atlamak istiyorsanız bir ISO-639 kodu verin (ör. `eng`, `spa`, `fra`, `deu`, `jpn`). - Çok konuşmacılı kayıtlarda `diarize` alanını etkin (varsayılan) bırakın; model her kelimeyi bir konuşmacıya atar. Tek konuşmacılı seslerde konuşmacı etiketlemesini atlamak için `false` yapın. - Konuşma dışı sesleri (kahkaha, alkış) metnin içinde işaretlemek için `tag_audio_events` alanını etkin (varsayılan) bırakın; yalnızca konuşmadan oluşan temiz bir transkript için `false` yapın. - Net ve yeterince yüksek sesli kaynak kayıtlar kullanın — yoğun arka plan gürültüsü ve üst üste binen konuşmalar doğruluğu düşürür.
## Gelişmiş Yapılandırma - `language_code` (varsayılan: otomatik algılama): transkripsiyon dilini algılamak yerine sabitleyen bir ISO-639 dil kodu. Ses kısa olduğunda ya da dil önceden biliniyorsa işe yarar. - `tag_audio_events` (boolean, varsayılan `true`): `true` olduğunda kahkaha ve alkış gibi konuşma dışı olaylar transkriptin içinde etiketlenir. - `diarize` (boolean, varsayılan `true`): `true` olduğunda her kelimeyi hangi konuşmacının söylediğini işaretler.
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("elevenlabs/scribe-v1", { input: { audio_url: "https://storage.googleapis.com/falserverless/web-examples/elevenlabs/sample.mp3", diarize: true, tag_audio_events: true, }, }); ```
