O Google anunciou os novos modelos Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS , voltados à geração de voz por inteligência artificial. As ferramentas trazem recursos para criar vozes personalizadas e mais expressivas, incluindo a reprodução de uma voz existente a partir de uma amostra de apenas 30 segundos. A tecnologia também consegue interpretar instruções de atuação e adicionar elementos, como risadas, sussurros e suspiros , às falas. Os novos modelos foram desenvolvidos para criar vozes expressivas e personalizadas em diferentes tipos de conteúdo. Eles podem ser usados em audiobooks e podcasts, na criação de vozes para personagens de jogos, em dublagens e na narração de vídeos. A função atende a simulações de atendimento ao cliente, treinamentos e produções narrativas. As empresas, inclusive, podem criar perfis de voz para manter uma identidade sonora consistente em diferentes conteúdos. Nos conteúdos de longa duração, a tecnologia busca manter a qualidade, o timbre e o tom da voz ao longo de horas de áudio, reduzindo o chamado speaker drift . O recurso é especialmente útil para audiobooks e podcasts, nos quais alterações na voz podem ficar mais perceptíveis. Os modelos também podem ser usados em dublagem e localização de conteúdo , com suporte a mais de 100 idiomas e dialetos. A lista inclui português brasileiro, francês do Quebec e espanhol mexicano. Também é possível gerar agentes de voz mais naturais, com interjeições como “mhm” e “yeah” durante conversas para simular sinais de escuta ativa e diálogos entre duas vozes diferentes a partir de um único roteiro. Para quem preferir, o catálogo já oferece mais de 2.000 vozes prontas para produção. Ainda, o Google prepara uma opção para personalizar as vozes da biblioteca com instruções em texto. A ferramenta deverá permitir ajustes de timbre, tom, ritmo e sotaque sem a necessidade de criar uma voz do zero. Assim, o Flash TTS tem foco em direção criativa e design de personagens , com controles detalhados para orientar a interpretação linha por linha. Já o Flash-Lite TTS foi desenvolvido para geração em alta escala , com foco em eficiência de custos. Além disso, o Google solicita uma gravação de consentimento verbal correspondente ao locutor de referência antes da reprodução de uma voz existente. Os áudios gerados pelos modelos Gemini Audio também recebem o SynthID , uma marca d'água imperceptível incorporada ao conteúdo para ajudar na identificação de material sintético, e credenciais C2PA , que registram informações sobre a origem e a autenticidade do conteúdo. A clonagem de voz pelo Google AI Studio tem algumas restrições regionais. A função não está disponível no Reino Unido, Espaço Econômico Europeu (EEE), Suíça, Índia e nos estados americanos de Illinois e Texas. Onde usar os novos modelos de voz do Gemini? O Gemini 3.8 Flash TTS será integrado ao Gemini Notebook e o Gemini 3.8 Flash-Lite TTS chegará ao [object Object] para gerar narrações e dublagens em apresentações e outros conteúdos em vídeo. Para desenvolvedores, os modelos já estão disponíveis na Gemini API e no Google AI Studio , que oferece um playground de áudio para testar a geração de voz e criar diálogos entre múltiplos personagens. O Google também prevê disponibilizar os modelos para clientes do Gemini Enterprise , mas ainda não detalhou todos os recursos que estarão disponíveis nessa versão. Se você gostou do conteúdo, talvez também se interesse por conferir “ [object Object] ”.






