Todas as vozes de narração que consigo gerar, femininas e masculinas, dizendo exatamente a mesma frase. Dá para comparar timbre sem viés de texto.
Thalita e a melhor voz gratuita em PT-BR que existe hoje sem instalar nada. Ela ja e suficiente para travar o tempo da VSL e, em muitos casos, para a peca final. Se o cliente pedir mais emoção, o caminho e clonar uma voz real, nao trocar de voz sintética.
É real e é boa: projeto do k2-fsa, 0,6 bilhão de parâmetros, roda em Apple Silicon, clona voz com poucos segundos de referência e cobre mais de 600 idiomas. Mas tem uma pegadinha de licença: o codigo e Apache 2.0, e os pesos do modelo são CC-BY-NC, ou seja, proibido uso comercial. Para VSL de cliente isso e um problema jurídico, não um detalhe. Serve para teste interno.
Na mesma família, o Qwen3-TTS e o que mais se aproxima do ElevenLabs em teste cego e tem licença permissiva. O Chatterbox (MIT) ganhou do ElevenLabs em 65% dos testes cegos, mas pede cerca de 8 GB de VRAM, o que este Mac não tem. O Fish Audio S2 Pro resolve pago, porém a cerca de um décimo do preço do ElevenLabs.
Fechar o tempo e a estrutura da VSL com a Thalita, que custa zero. Só trocar por voz clonada ou paga se, ouvindo a peça montada, a voz for o elo mais fraco. Na maioria das VSL, o elo mais fraco e a copy.