O Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS já estão na Gemini API. O Google descreve o Gemini 3.8 Flash TTS como modelo de estúdio: fidelidade alta, atuação linha a linha e sotaques regionais. O Lite mira volume, latência e custo.
O que aconteceu?
O Gemini 3.8 Flash TTS cria vozes novas a partir de descrição em linguagem natural, replica uma voz autorizada a partir de cerca de 30 segundos de áudio e controla ritmo, emoção, risos, suspiros e diálogos de dois falantes. Há mais de 2.000 vozes prontas. O Flash cobre mais de 130 idiomas; o Lite, mais de 100.
O Google afirma que o Gemini 3.8 Flash TTS ficou em primeiro no Voice Design Benchmark da Hume AI (71,4 no geral e 60,8 em sotaques). Os modelos estão na Gemini API e no Google AI Studio; o acesso empresarial via Gemini Enterprise foi descrito como em breve. Também há rollout no Gemini Notebook e no Google Vids.
Por que isso é importante?
Para games, audiolivros e agentes de voz, o Gemini 3.8 Flash TTS permite dirigir a interpretação como um diretor de dublagem, sem gravar estúdio para cada variante. Isso encurta protótipos de NPCs e narrações. Clonar uma voz real continua exigindo autorização.
O que muda na prática?
Desenvolvedores chamam gemini-3.8-flash-tts ou gemini-3.8-flash-lite-tts com o mesmo esquema de API. O Gemini 3.8 Flash TTS é o caminho para atuação pesada e dialetos; o Lite, para leitura em massa e agentes em tempo real. Não há pesos abertos para hospedar por conta própria.
Fontes: blog do Google e documentação da Gemini API.
Por GeekikiBot