Clonagem de Voz por IA para o Português Brasileiro em Contexto Assistivo: Desafios Comparativos em Cinco Ferramentas de Síntese de Fala
Resumo
Modelos de síntese neural de fala apresentam desempenho reduzido para o português brasileiro (PT-BR) em vozes infantis, prosódia emocional e fonemas sublexicais. Este trabalho avalia cinco ferramentas de síntese por IA em contexto assistivo, com 170 gravações como corpus controlado. Dois desafios persistiram: prosódia emocional e fonemas do PT-BR ausentes do inglês. A incorporação do dataset multilingual-phonemes-10k-alpha ao StyleTTS 2 produziu melhoria consistente na qualidade fonética regional. Os achados oferecem avaliação comparativa e evidência de estratégia de baixo custo para ampliar a cobertura fonética do PT-BR.Referências
Araújo, G. E. et al. (2026). Certas Palavras: A 1980s–90s Brazilian Radio Corpus to Test TTS Models in Noisy Multi-Speaker Dialogues. In Proceedings of PROPOR 2026. ACL Anthology.
Barakat, H.; Turk, O.; Demiroglu, C. (2024). Deep learning-based expressive speech synthesis: a systematic review of approaches, challenges, and resources. EURASIP Journal on Audio, Speech, and Music Processing. DOI: 10.1186/s13636-024-00329-7.
Bott, L. et al. (2024). Controlling Emotion in Text-to-Speech with Natural Language Prompts. In Proceedings of Interspeech 2024. ISCA.
Casanova, E.; Júnior, A. C.; Shulby, C.; Oliveira, F. S.; Teixeira, J. P.; Ponti, M. A.; Aluísio, S. (2022). TTS-Portuguese Corpus: a corpus for speech synthesis in Brazilian Portuguese. Language Resources and Evaluation, 56, 1043–1055. DOI: 10.1007/s10579-021-09570-4.
Casanova, E. et al. (2022b). YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot Voice Conversion for Everyone. In Proceedings of ICML 2022. PMLR.
Casanova, E. et al. (2024). XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model. arXiv:2406.04904.
Casanova, E.; Santos, V. G.; Svartman, F. R. F.; Leite, M. Q.; Candido Junior, A.; Marcacini, R. M.; Rezende, S. O.; Aluísio, S. M. (2026). Recursos para o processamento de fala. In Caseli, H. M.; Nunes, M. G. V. (orgs), Processamento de Linguagem Natural: Conceitos, Técnicas e Aplicações em Português. 4ª ed., v.1. BPLN. DOI: 10.5281/zenodo.19259398.
Chen, X. et al. (2024). F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching. arXiv:2410.06885.
Cho, J. et al. (2025). ECE-TTS: A Zero-Shot Emotion Text-to-Speech Model with Simplified and Precise Control. Applied Sciences, MDPI, 15(9), 5108.
ElevenLabs. (2024). Voice cloning and text-to-speech API. Disponível em: elevenlabs.io.
Gomes, E.; Pedroso, F. S.; Wagner, M. B. (2008). Hipersensibilidade auditiva no transtorno do espectro autístico. Pró-Fono, v. 20, p. 279–284.
Jurafsky, D.; Martin, J. H. (2023). Speech and Language Processing (3rd ed. draft). Stanford University.
Li, Y. A. et al. (2023). StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models. In Proceedings of NeurIPS 2023. arXiv:2306.07691.
Maia, R. et al. (2023). Prosódia e síntese da fala: uma revisão integrativa da literatura em português brasileiro. Revista da ABRALIN.
Oliveira, J.; Albuquerque, F. E. (2021). Leitura e escrita em crianças com autismo: o trabalho psicopedagógico a partir do método fônico. Facit Business and Technology Journal, 1(29).
Otto-Meyer, S. et al. (2018). Children with autism spectrum disorder have unstable neural responses to sound. Experimental Brain Research, 236, 733–743.
Rebouças, G. et al. (2021). Modelagem 3D do Robô Otto para o atendimento de crianças com Transtorno do Espectro Autista. In: Anais da XXI Escola Regional de Informática de Mato Grosso (ERI-MT), p. 35-41. Porto Alegre: SBC.
Scassellati, B.; Admoni, H.; Mataric, M. (2012). Robots for Use in Autism Research. Annual Review of Biomedical Engineering, v. 14, p. 275–294.
StyleTTS2 Community. (2024). multilingual-phonemes-10k-alpha. Hugging Face Datasets. Disponível em: huggingface.co/datasets/styletts2-community/multilingual-phonemes-10k-alpha.
Chen, X. et al. (2024). F5-TTS. GitHub: SWivid/F5-TTS. Disponível em: [link].
Hexgrad. (2024). Kokoro-82M. Hugging Face. Apache 2.0. Disponível em: [link].
OHF-Voice. (2025). Piper 1 — Fast and local neural text-to-speech engine. GitHub: OHF-Voice/piper1-gpl. GPL.
RVC Project. (2023). Retrieval-based Voice Conversion WebUI. GitHub: RVC-Project/Retrieval-based-Voice-Conversion-WebUI.
Barakat, H.; Turk, O.; Demiroglu, C. (2024). Deep learning-based expressive speech synthesis: a systematic review of approaches, challenges, and resources. EURASIP Journal on Audio, Speech, and Music Processing. DOI: 10.1186/s13636-024-00329-7.
Bott, L. et al. (2024). Controlling Emotion in Text-to-Speech with Natural Language Prompts. In Proceedings of Interspeech 2024. ISCA.
Casanova, E.; Júnior, A. C.; Shulby, C.; Oliveira, F. S.; Teixeira, J. P.; Ponti, M. A.; Aluísio, S. (2022). TTS-Portuguese Corpus: a corpus for speech synthesis in Brazilian Portuguese. Language Resources and Evaluation, 56, 1043–1055. DOI: 10.1007/s10579-021-09570-4.
Casanova, E. et al. (2022b). YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot Voice Conversion for Everyone. In Proceedings of ICML 2022. PMLR.
Casanova, E. et al. (2024). XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model. arXiv:2406.04904.
Casanova, E.; Santos, V. G.; Svartman, F. R. F.; Leite, M. Q.; Candido Junior, A.; Marcacini, R. M.; Rezende, S. O.; Aluísio, S. M. (2026). Recursos para o processamento de fala. In Caseli, H. M.; Nunes, M. G. V. (orgs), Processamento de Linguagem Natural: Conceitos, Técnicas e Aplicações em Português. 4ª ed., v.1. BPLN. DOI: 10.5281/zenodo.19259398.
Chen, X. et al. (2024). F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching. arXiv:2410.06885.
Cho, J. et al. (2025). ECE-TTS: A Zero-Shot Emotion Text-to-Speech Model with Simplified and Precise Control. Applied Sciences, MDPI, 15(9), 5108.
ElevenLabs. (2024). Voice cloning and text-to-speech API. Disponível em: elevenlabs.io.
Gomes, E.; Pedroso, F. S.; Wagner, M. B. (2008). Hipersensibilidade auditiva no transtorno do espectro autístico. Pró-Fono, v. 20, p. 279–284.
Jurafsky, D.; Martin, J. H. (2023). Speech and Language Processing (3rd ed. draft). Stanford University.
Li, Y. A. et al. (2023). StyleTTS 2: Towards Human-Level Text-to-Speech through Style Diffusion and Adversarial Training with Large Speech Language Models. In Proceedings of NeurIPS 2023. arXiv:2306.07691.
Maia, R. et al. (2023). Prosódia e síntese da fala: uma revisão integrativa da literatura em português brasileiro. Revista da ABRALIN.
Oliveira, J.; Albuquerque, F. E. (2021). Leitura e escrita em crianças com autismo: o trabalho psicopedagógico a partir do método fônico. Facit Business and Technology Journal, 1(29).
Otto-Meyer, S. et al. (2018). Children with autism spectrum disorder have unstable neural responses to sound. Experimental Brain Research, 236, 733–743.
Rebouças, G. et al. (2021). Modelagem 3D do Robô Otto para o atendimento de crianças com Transtorno do Espectro Autista. In: Anais da XXI Escola Regional de Informática de Mato Grosso (ERI-MT), p. 35-41. Porto Alegre: SBC.
Scassellati, B.; Admoni, H.; Mataric, M. (2012). Robots for Use in Autism Research. Annual Review of Biomedical Engineering, v. 14, p. 275–294.
StyleTTS2 Community. (2024). multilingual-phonemes-10k-alpha. Hugging Face Datasets. Disponível em: huggingface.co/datasets/styletts2-community/multilingual-phonemes-10k-alpha.
Chen, X. et al. (2024). F5-TTS. GitHub: SWivid/F5-TTS. Disponível em: [link].
Hexgrad. (2024). Kokoro-82M. Hugging Face. Apache 2.0. Disponível em: [link].
OHF-Voice. (2025). Piper 1 — Fast and local neural text-to-speech engine. GitHub: OHF-Voice/piper1-gpl. GPL.
RVC Project. (2023). Retrieval-based Voice Conversion WebUI. GitHub: RVC-Project/Retrieval-based-Voice-Conversion-WebUI.
Publicado
19/10/2026
Como Citar
SANTOS, Luiz G. dos; BORGES, Nathalia; SALES, Matheus; BORGES, Luciana C. L. F.; KEMPNER, Thais R.; NUNES, Eunice P. S..
Clonagem de Voz por IA para o Português Brasileiro em Contexto Assistivo: Desafios Comparativos em Cinco Ferramentas de Síntese de Fala. In: SIMPÓSIO BRASILEIRO DE TECNOLOGIA DA INFORMAÇÃO E DA LINGUAGEM HUMANA (STIL), 17. , 2026, Cuiabá/MT.
Anais [...].
Porto Alegre: Sociedade Brasileira de Computação,
2026
.
p. 348-360.
DOI: https://doi.org/10.5753/stil.2026.26551.
