Gemini ganha clonagem de voz em 30 segundos com risos e sussurros

·

·

O assistente Gemini, da Google, recebeu uma atualização que permite clonar a voz de um usuário a partir de apenas 30 segundos de amostra de áudio. A novidade inclui entonações expressivas, como risos e sussurros, para tornar as interações por voz mais naturais.

O que a atualização traz

Segundo o Canaltech, o novo recurso do Gemini analisa uma gravação curta de voz e reproduz o timbre e as características vocais do usuário em respostas geradas pela inteligência artificial. Além do tom de voz, a ferramenta consegue simular variações emocionais, como risadas e sussurros, aproximando a experiência de uma conversa humana real.

Essa tecnologia é conhecida como clonagem de voz, processo em que um sistema de IA aprende padrões sonoros específicos de uma pessoa para depois reproduzi-los em outras falas geradas artificialmente.

Por que essa novidade chama atenção

A clonagem de voz vem avançando rapidamente entre assistentes de inteligência artificial, e reduzir o tempo necessário de amostra de áudio para apenas 30 segundos representa um salto em relação a tecnologias anteriores, que geralmente exigiam gravações mais longas para obter resultados satisfatórios.

A inclusão de nuances como risos e sussurros também é um ponto de destaque, já que a naturalidade da fala é um dos maiores desafios para tornar assistentes virtuais mais próximos da comunicação humana.

O que muda para quem usa

Para os usuários, a novidade pode tornar as interações com o Gemini mais personalizadas, permitindo que o assistente responda com uma voz semelhante à do próprio usuário ou de outras vozes cadastradas, dependendo da configuração disponibilizada pela Google.

A tecnologia também abre espaço para aplicações em acessibilidade, produção de conteúdo e ferramentas de comunicação, embora o uso de vozes clonadas também levante discussões sobre consentimento e uso indevido da tecnologia.

O que observar daqui para frente

Resta acompanhar como a Google vai regular o uso dessa funcionalidade para evitar problemas relacionados à falsificação de identidade por voz, prática que tem preocupado especialistas em segurança digital diante do avanço de ferramentas de IA generativa.

Mais detalhes sobre a atualização podem ser conferidos na reportagem original do Canaltech.


Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *