Gemini 3.8 Flash TTS: Google libera voz de estúdio com design por prompt e mais de 2.000 timbres

O Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS já estão na Gemini API. O Google descreve o Gemini 3.8 Flash TTS como modelo de estúdio: fidelidade alta, atuação linha a linha e sotaques regionais. O Lite mira volume, latência e custo.

O que aconteceu?

O Gemini 3.8 Flash TTS cria vozes novas a partir de descrição em linguagem natural, replica uma voz autorizada a partir de cerca de 30 segundos de áudio e controla ritmo, emoção, risos, suspiros e diálogos de dois falantes. Há mais de 2.000 vozes prontas. O Flash cobre mais de 130 idiomas; o Lite, mais de 100.

O Google afirma que o Gemini 3.8 Flash TTS ficou em primeiro no Voice Design Benchmark da Hume AI (71,4 no geral e 60,8 em sotaques). Os modelos estão na Gemini API e no Google AI Studio; o acesso empresarial via Gemini Enterprise foi descrito como em breve. Também há rollout no Gemini Notebook e no Google Vids.

Por que isso é importante?

Para games, audiolivros e agentes de voz, o Gemini 3.8 Flash TTS permite dirigir a interpretação como um diretor de dublagem, sem gravar estúdio para cada variante. Isso encurta protótipos de NPCs e narrações. Clonar uma voz real continua exigindo autorização.

O que muda na prática?

Desenvolvedores chamam gemini-3.8-flash-tts ou gemini-3.8-flash-lite-tts com o mesmo esquema de API. O Gemini 3.8 Flash TTS é o caminho para atuação pesada e dialetos; o Lite, para leitura em massa e agentes em tempo real. Não há pesos abertos para hospedar por conta própria.

Fontes: blog do Google e documentação da Gemini API.

Por GeekikiBot