Model Detayları
Whisper Large v3, OpenAI’ın open source, çok dilli konuşma tanıma modelidir. Bir ses dosyasının URL’sini verin (mp3, mp4, mpeg, mpga, m4a, wav ya da webm); model tam transkripti düz metin olarak döndürür. Otomatik dil algılamayla 99 dili işler, konuşulan herhangi bir dili İngilizce metne çevirebilir ve segment ya da kelime düzeyinde zaman damgalarının yanı sıra isteğe bağlı diarization (konuşmacı ayrımı) sunar. Kayıtları aranabilir, kullanılabilir metne dönüştürmek için sağlam, genel amaçlı bir varsayılan tercihtir.
## En uygun olduğu işler - Toplantıları, röportajları, podcast’leri, dersleri ve sesli notları yazıya dökmek - Konuşulan dilin bilinmediği ya da karışık olduğu çok dilli transkripsiyon (99 dil, otomatik algılanır) - İngilizce olmayan sesleri tek çağrıda doğrudan İngilizce metne çevirmek (`task: "translate"`) - Altyazı ve kapalı altyazı için zaman damgalı segmentler ya da kelime düzeyinde parçalar üretmek - Diarization ile çok kişili kayıtların konuşmacıya atfedilmiş transkriptleri
## Şu durumlarda başka bir model seçin - Yazıya dökmek yerine metinden konuşma üretmek istiyorsanız — bir text-to-speech modeli kullanın - Devam eden bir görüşmenin canlı, streaming transkripsiyonu gerekiyorsa — bu model yüklenmiş tam bir dosyayı işler ve bitmiş bir transkript döndürür - Yerleşik ses olayı etiketlemesiyle (kahkaha, alkış) en yüksek doğrulukta İngilizce transkripsiyon istiyorsanız — `elevenlabs/scribe-v1` modelini değerlendirin
## İpuçları - Konuşulan dilin otomatik algılanması için `language` alanını boş bırakın; bir ISO kodunu (ör. `en`, `es`, `fr`, `de`, `ja`) yalnızca dil biliniyorsa, algılamayı atlamak için verin. - Kaynak dil ne olursa olsun İngilizce çıktı almak için `task` değerini `translate` yapın; konuşulan dilde çıktı için `transcribe` (varsayılan) olarak bırakın. - Zaman damgalarının ayrıntı düzeyini `chunk_level` ile belirleyin: `segment` (varsayılan) cümle düzeyinde parçalar, `word` kelime başına zaman damgaları döndürür; `none` ise zaman damgası token’larını atlayarak küçük bir hız kazancı sağlar. - `diarize` seçeneğini yalnızca çok konuşmacılı seslerde açın; her parçayı kimin söylediğini etiketler ama işlem süresini uzatır (faturalandırma işlem süresini izlediği için maliyeti de artırır).
## Gelişmiş Yapılandırma - `task` (varsayılan `transcribe`): `transcribe` konuşulan dili korur; `translate` İngilizce çıktı verir. - `chunk_level` (varsayılan `segment`): zaman damgası ayrıntı düzeyi — `none`, `segment` ya da `word`. - `diarize` (boolean, varsayılan `false`): her parçayı hangi konuşmacının söylediğini işaretler. Daha fazla işlem süresi gerektirir. - `num_speakers` (varsayılan: otomatik): beklenen konuşmacı sayısı için bir ipucu; yalnızca `diarize` `true` olduğunda kullanılır. - `prompt` (varsayılan: boş): transkripsiyonu belirli terimlere ya da yazımlara yönlendirmek için bir metin ipucu. - `batch_size` (varsayılan 64): dahili batch işleme; throughput’u ince ayarlamıyorsanız varsayılanda bırakın.
Maliyet notu: bu model transkripsiyon isteği başına faturalandırılır. Fiyat, ses uzunluğundan bağımsız olarak çıktı başına sabittir.
ModelRunner JavaScript client ile çalıştırmak için: ```js import { modelrunner } from "@modelrunner/client";
const result = await modelrunner.subscribe("openai/whisper", { input: { audio_url: "https://media.modelrunner.ai/iuneUX0YY4AtcsceV9HHp.mp3", task: "transcribe", chunk_level: "segment", }, }); ```
