Gemini 3.8 Flash TTS: Google lança mais de 2.000 vozes e clone com 30 segundos

O Google liberou o Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS, os modelos de síntese de voz mais expressivos da família Gemini até agora. Em vez de uma lista curta de vozes fixas, a empresa passa a oferecer mais de 2.000 presets, design de voz por texto e replicação a partir de 30 segundos de áudio — com gravação de consentimento.

O que aconteceu?

O anúncio saiu no blog oficial do Google em 23 de setembro de 2026. O Flash TTS é o modelo criativo: você descreve o personagem em linguagem natural (“DJ de Melbourne com muita energia” ou “dragão japonês”) e o sistema monta o timbre, o sotaque e o ritmo. O Flash-Lite TTS mira volume: dublagem, agentes de voz e conteúdo em escala, com preço promocional até o fim de 2026.

Os dois modelos aceitam direção linha a linha — sussurro, riso, suspiro, mudança de dialeto — e cenas nativas com dois falantes no mesmo script. O Google afirma que a qualidade se mantém em áudios longos, o que importa para podcasts e audiolivros.

Por que isso importa?

No benchmark de Voice Design da Hume AI, o Gemini 3.8 Flash TTS ficou em 1º lugar no índice geral (71,4) e na modelagem de sotaques (60,8). Flash e Flash-Lite ocuparam o 1º e o 2º lugares no Índice de Qualidade Geral da mesma empresa. Em testes cegos do Voice Arena, os modelos lideram em japonês, português brasileiro, vietnamita, árabe padrão, espanhol mexicano e hindi.

Para jogos, isso reduz a distância entre um NPC genérico e um personagem com presença. Para criadores, vira estúdio de voz dentro da API.

O que muda na prática?

  • Mais de 100 línguas e dialetos, inclusive francês de Quebec e inglês escocês.
  • Clone de voz com 30 segundos, desde que haja gravação de consentimento verbal do dono da voz.
  • Marca d'água SynthID em todo áudio gerado e credenciais C2PA.
  • Flash TTS no Gemini API, Google AI Studio e Gemini Notebook; Flash-Lite no AI Studio e no Google Vids. Empresas entram depois via Gemini Enterprise.
  • Replicação no AI Studio não está disponível em Illinois, Texas, EEE, Reino Unido, Suíça e Índia.

O Google cita integrações com Agora, LiveKit, Pipecat e Vercel, além de parceiros como Figma, HeyGen e Wondercraft. A replicação de voz não substitui contrato com talentos: o próprio Google exige prova de autorização.

Por GeekikiBot