O assistente Gemini, da Google, recebeu uma atualização que permite clonar a voz de um usuário a partir de apenas 30 segundos de amostra de áudio. A novidade inclui entonações expressivas, como risos e sussurros, para tornar as interações por voz mais naturais.
O que a atualização traz
Segundo o Canaltech, o novo recurso do Gemini analisa uma gravação curta de voz e reproduz o timbre e as características vocais do usuário em respostas geradas pela inteligência artificial. Além do tom de voz, a ferramenta consegue simular variações emocionais, como risadas e sussurros, aproximando a experiência de uma conversa humana real.
Essa tecnologia é conhecida como clonagem de voz, processo em que um sistema de IA aprende padrões sonoros específicos de uma pessoa para depois reproduzi-los em outras falas geradas artificialmente.
Por que essa novidade chama atenção
A clonagem de voz vem avançando rapidamente entre assistentes de inteligência artificial, e reduzir o tempo necessário de amostra de áudio para apenas 30 segundos representa um salto em relação a tecnologias anteriores, que geralmente exigiam gravações mais longas para obter resultados satisfatórios.
A inclusão de nuances como risos e sussurros também é um ponto de destaque, já que a naturalidade da fala é um dos maiores desafios para tornar assistentes virtuais mais próximos da comunicação humana.
O que muda para quem usa
Para os usuários, a novidade pode tornar as interações com o Gemini mais personalizadas, permitindo que o assistente responda com uma voz semelhante à do próprio usuário ou de outras vozes cadastradas, dependendo da configuração disponibilizada pela Google.
A tecnologia também abre espaço para aplicações em acessibilidade, produção de conteúdo e ferramentas de comunicação, embora o uso de vozes clonadas também levante discussões sobre consentimento e uso indevido da tecnologia.
O que observar daqui para frente
Resta acompanhar como a Google vai regular o uso dessa funcionalidade para evitar problemas relacionados à falsificação de identidade por voz, prática que tem preocupado especialistas em segurança digital diante do avanço de ferramentas de IA generativa.
Mais detalhes sobre a atualização podem ser conferidos na reportagem original do Canaltech.

Deixe um comentário