Model Detayları
Gemini 3.1 Flash TTS, Google’ın kontrol edilebilir text-to-speech modelidir. Yazılı metni doğal ve ifadeli bir konuşmaya dönüştürür; performansı markup ya da SSML yerine düz bir dille yönlendirmenize izin verir.
`prompt` alanı hem stil yönergesini hem de söylenecek sözleri taşır; biçimi `{style instruction}: {text}` şeklindedir — örneğin `Say the following in a warm, curious way: OK, so... tell me about this AI thing.` Model bu yönergeyi aksan, tempo, ton ve duygusal ifade için izler; böylece aynı cümle hiçbir şeyi yeniden kaydetmeden fısıltı, haber spikeri okuması, heyecanlı bir ara söz ya da sakin bir sesli kitap anlatımı olarak seslendirilebilir. Onu klasik bir konuşma sentezleyicisine tercih etmenin başlıca sebebi budur: okuyuş, sesin sabit bir özelliği değil, bir parametredir.
Otuz hazır ses sunulur, her birinin kendi karakteri vardır — Kore kararlı, Puck neşeli, Aoede rahat, Charon bilgilendirici, Sulafat sıcak, Enceladus fısıltılı, Gacrux olgun, Zubenelgenubi senli benli — ve hepsi `language_code` ile desteklenen bir locale’e eşlenebilir. Gemini 3.1 ayrıca metnin içine yerleştirebileceğiniz `[laughs]` ya da `[sigh]` gibi ifadeli ses etiketleri sunar; bunlar tek başına bir stil cümlesinin verdiğinden daha ince bir anlatım kontrolü sağlar.
Prompt ve metin toplamda kabaca 8,000 byte ile sınırlıdır ve tek bir çağrı yaklaşık 655 saniyeye kadar ses döndürür; bundan uzun girdi kırpılır. Çıktı 24 kHz mono bir WAV dosyasıdır ve faturalandırma üretilen sesin saniyesi üzerindendir; bu yüzden kısa bir replik bir sentin küçük bir kesri kadar tutar.
Seslendirme ve anlatım, sesli kitap ve e-öğrenme, IVR ve asistan anonsları, karakter diyalogları için ve genel bir okuyuş yerine belirli bir okuyuşa ihtiyaç duyduğunuz her yerde kullanın.
