Gradium AI lança novo modelo padrão de síntese de voz com taxa de acerto de 81% em casos difíceis

A Gradium AI disponibilizou um novo modelo de conversão de texto em fala, conhecido como TTS (do inglês Text-to-Speech), e o tornou a opção padrão em sua API e no Studio a partir do dia 31 de agosto de 2026. A empresa afirma que o sistema alcança uma taxa de aprovação de 81% em avaliações humanas realizadas sobre um conjunto de 500 frases consideradas difíceis para assistentes de voz, resultado superior ao de concorrentes diretos testados no mesmo cenário.

Gradium AI redefine a síntese de voz: novo modelo atinge 81% de precisão nos casos mais difíceis e deixa concorrentes para trás - Imagem complementar

O foco do desenvolvimento está nos trechos das chamadas em que os agentes de voz costumam falhar, como a pronúncia de números de pedido, dígitos de retorno, endereços de e-mail e códigos de referência. Segundo a Gradium, o novo modelo consegue ler esses elementos sem que o desenvolvedor precise aplicar nenhum tipo de pré-processamento ou normalização textual antes do envio do conteúdo.

PUBLICIDADE

Para medir o desempenho, a empresa construiu um conjunto de avaliação com 500 frases, distribuídas em 100 itens por idioma, contemplando cinco línguas: inglês, alemão, francês, espanhol e português. O material foi organizado em dez critérios, sendo sete atômicos, que cobrem ortografia, siglas, tokens alfanuméricos, datas, números comuns, números extensos e de ponto flutuante, além de endereços de e-mail. Os outros três critérios são compostos e simulam situações reais de atendimento, como pedidos, tickets de TI e reclamações, reunindo vários elementos em um único turno de fala.

A avaliação foi conduzida por avaliadores humanos nativos de cada idioma, sob regras rígidas: uma frase só é considerada aprovada quando todos os elementos são pronunciados de forma correta e completa. Isso significa que um único dígito omitido já reprova a frase inteira. Os áudios foram normalizados em volume, a ordem de apresentação foi randomizada e cada avaliador teve limite de 40 comparações por sessão, com pausa obrigatória. O conjunto completo de testes foi disponibilizado publicamente no Hugging Face sob licença Creative Commons BY 4.0.

Nos resultados agregados, o novo modelo da Gradium atingiu 81% de aprovação, seguido pelo Cartesia Sonic 3.6, com 75,1%, e pelo ElevenLabs v3 Conversational, com 65,4%. Mais atrás aparecem o Fish Audio S2.1 Pro, com 49,5%, e o Inworld TTS 1.5 Max, com 46,5%. Todas as amostras foram geradas em agosto de 2026, utilizando as configurações padrão de cada plataforma.

Além da precisão na pronúncia, a empresa destaca o desempenho em latência. No benchmark de TTS da Coval, o modelo registrou um tempo até o primeiro áudio, chamado de TTFA (Time To First Audio), de 216 milissegundos no percentil 50, o que representa uma redução de 170 milissegundos em relação ao modelo anterior. O intervalo interquartil, que mede a dispersão entre os percentis 25 e 75 ao longo de 480 execuções, ficou em 30 milissegundos, o mais estreito entre os cinco modelos avaliados.

Para efeito de comparação, o Cartesia Sonic 3.6 apresentou mediana de 454 milissegundos com dispersão de 165 milissegundos, o equivalente a 36% do próprio valor mediano. O Inworld TTS 2 registrou 166 milissegundos de mediana, sendo o mais rápido nesse indicador, mas a Gradium opta por destacar a combinação de baixa latência e alta precisão, e não apenas a velocidade bruta. Fish Audio S2.1 Pro e ElevenLabs v3 Conversational ficaram em 291 e 329 milissegundos, respectivamente.

A implantação do novo modelo ocorre de forma automática. Clientes que já utilizam a plataforma não precisam realizar migração, e vozes previamente configuradas, incluindo clones personalizados, continuam funcionando sem alterações. Para novos usuários, a empresa indica a instalação do SDK em Python e o uso do endpoint WebSocket de TTS, mantendo os identificadores de voz já criados.

Como parte do processo de aprimoramento, a Gradium está oferecendo um milhão de créditos para desenvolvedores que enviarem relatórios completos de falhas em casos difíceis por meio do seu servidor no Discord. A empresa reconhece que o benchmark foi conduzido por ela mesma, mas argumenta que a abertura do conjunto de testes permite que a comunidade reproduza e verifique os resultados de forma independente.

Com o lançamento, a Gradium reforça a aposta em modelos de síntese de voz voltados para cenários de atendimento automatizado, nos quais a pronúncia correta de dados alfanuméricos costuma ser determinante para a experiência do usuário. A combinação entre taxa de aprovação superior à dos concorrentes avaliados, baixa latência e estabilidade nos tempos de resposta coloca o novo modelo como referência para aplicações em produção que dependem de comunicação por voz em múltiplos idiomas.