Classificação automática de sentenças faladas com arquitetura híbrida: análise de estruturas topicalizadas, anti-topicalizadas e canônicas

  • Gerson Vitor P. Fernandes UERN
  • Vitoria Maria A. Silva UFERSA
  • Cid Ivan C. Carvalho UFERSA

Resumo


O presente artigo investiga o desempenho de um sistema de classificação automática de sentenças faladas do português brasileiro, considerando estruturas canônicas, topicalizadas e antitopicalizadas, por meio de uma arquitetura híbrida baseada em Redes Neurais Recorrentes (RNNs) e Redes Neurais Convolucionais (CNNs). A pesquisa articula contribuições sintáticas, prosódicas e computacionais com a finalidade de contextualizar o corpus e delimitar o tratamento das sentenças faladas, porém o estudo concentra-se na avaliação experimental de uma arquitetura híbrida de redes neurais aplicada à classificação automática dessas sentenças. O corpus analisado é composto por 612 sentenças declarativas gravadas em ambiente controlado, produzidas por 20 falantes do português brasileiro. A metodologia caracteriza-se como quantitativa e experimental, utilizando aprendizagem supervisionada e avaliação baseada em métricas como precisão, recall, f-score e acurácia, por meio da matriz de confusão. Foram realizados testes com diferentes configurações de hiperparâmetros, variando filtros convolucionais, unidades LSTM, taxas de Dropout e número de épocas de treinamento. Os resultados demonstraram que modelos mais robustos apresentaram maior capacidade de memorização dos dados de treino, mas também maior tendência ao overfitting. Em contrapartida, arquiteturas mais enxutas associadas a maiores taxas de regularização obtiveram melhor capacidade de generalização e maior estabilidade durante a validação. O melhor desempenho foi observado no cenário com 30% de Dropout, em que houve redução significativa do hiato de generalização entre treino e teste. Conclui-se que a combinação entre RNNs e CNNs mostra-se promissora para a classificação automática de sentenças faladas, embora ainda existam limitações relacionadas à generalização do modelo em dados não vistos.

Palavras-chave: Modelo de classificação, Redes neurais, Arquitetura Híbrida, Frases faladas

Referências

ALMEIDA, Rodrigo José S. et al. Aprendizado de máquina no apoio à transcrição e classificação da fala gaguejada: uma revisão sistemática da literatura. Simpósio Brasileiro de Computação Aplicada à Saúde (SBCAS), p. 400-411, 2024.

AZEVEDO, Gabriel Almeida et al. Análise acústica da fala para auxílio à detecção e à classificação de distúrbios da voz. 2025.

Barbosa, P. A. (2019). Prosódia, São Paulo, Parábola.

Barbosa, P. A. (2022). Manual de Prosódia Experimental, 1 ed, Editora da Abralin.

Berlinck, R. A.; Duarte, M. E. L. and Oliveira, M. (2009). Predicação. In Castilho, A. T., Kato, M. A., Nascimento, M., Gramática do português culto falado no Brasil, Campinas, Editora da Unicamp.

CARVALHO, Cid Ivan C.; OLIVEIRA, Francisca Ticiany B. L.; SILVA, Vitória Maria A.. Modelo de Classificação Automática de Frases Faladas com Abordagem em Redes Neurais Convolucionais. In: SIMPÓSIO BRASILEIRO DE TECNOLOGIA DA INFORMAÇÃO E DA LINGUAGEM HUMANA (STIL), 16. , 2025, Fortaleza/CE. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2025 . p. 519-525. DOI: 10.5753/stil.2025.37852.

Casanova et al. (2024). Recursos para o Processamento de Fala. In Caseli, H. M. and Nunes, M.G.V. (org.) Processamento de Linguagem Natural: Conceitos, Técnicas e Aplicações em Português, 2 ed, BPLN. Disponível em: [link].

Catarino, M. H (2025). Redes Neurais. Rio de Janeiro, Editora Freitas Bastos.

DESHPANDE, Kedar et al. A Time-Distributed CNN-LSTM with Attention Model for Speech Based Emotion Recognition. In: Proceedings of the 2024 7th International Conference on Digital Medicine and Image Processing. 2024. p. 67-71.

DIJKSTRA, Bauke Alfredo. Reconhecimento de fonemas utilizando redes neurais convolucionais para transcrição fonética automática. 2021. Dissertação de Mestrado. Universidade Tecnológica Federal do Paraná.

FACELI, Katti et al. Inteligência artificial: uma abordagem de aprendizado de máquina. 2011.

KENEDY, Eduardo. O status tipológico das construções de tópico no Português Brasileiro: uma abordagem experimental. Revista da ABRALIN, 2014.

LADD, D. Robert; COUTO, Tradução de Letícia Rebollo; SEARA, Izabel Christine. O que é prosódia. Working Papers em Linguística, v. 20, n. 1, p. 8-46, 2019.

LI, Charles N.; THOMPSON, Sandra A. Subject and topic: A new typology of language. In: Subject and topic. Routledge, 1976. p. 457-489.

Lira, Z. (2009). A entoação modal em cinco falares do Nordeste brasileiro, Tese (Doutorado) - UFPB, João Pessoa.

Lucente, L. (2022). Notação Entoacional. In Oliveira Júnior, M. Prosódia, Prosódias, Editora Contexto, pages 45-66.

MONARD, Maria Carolina; BARANAUSKAS, José Augusto. Conceitos sobre aprendizado de máquina. Sistemas inteligentes-Fundamentos e aplicações, v. 1, n. 1, p. 32, 2003.

MOURA, Gustavo Bennemann de. Redes neurais recorrentes para a classificação de estruturas retóricas. 2018.

Pontes, E. (1987). O Tópico no Português do Brasil. Campinas, Editora Pontes.

Raso, T.; Teixeira, B.; Barbosa, P. (2020). Modelling automatic detection of prosodic boundaries for Brazilian Portuguese spontaneous speech. Journal of Speech Sciences, Campinas, SP, v. 9, n. 00, pages 105–128. DOI: 10.20396/joss.v9i00.14957. Disponível em: [link].

SCARPA, E. M (Org). Estudos de prosódia. Campinas: Unicamp, 1999.

Srivastava, N. et al. (2014). Dropout: A Simple Way to Prevent Neural Networks from Overfitting, Journal of Machine Learning Research, 15, pages 1929-1958. [link].

Wagner, A. (2008). Automatic labeling of prosody, ITRW on Experimental Linguistics, ExLing 2008, 25-27 August 2008, Athens, Greece. Disponível em: [link].

Wibawa, I.D.G.Y.A; Darmawan, I.D.M.B.A (2021). Implementation of audio recognition using mel frequency cepstrum coefficient and dynamic time warping in wirama praharsini, Journal of Physics: Conference Series, DOI: 10.1088/1742-6596/1722/1/012014.

Wightman, C.W.; Ostendorf, M. (1994). Automatic labeling of prosodic patterns, IEEE Transactions on Speech and Audio Processing, 2(4), pages 469–481.
Publicado
19/10/2026
FERNANDES, Gerson Vitor P.; SILVA, Vitoria Maria A.; CARVALHO, Cid Ivan C.. Classificação automática de sentenças faladas com arquitetura híbrida: análise de estruturas topicalizadas, anti-topicalizadas e canônicas. In: SIMPÓSIO BRASILEIRO DE TECNOLOGIA DA INFORMAÇÃO E DA LINGUAGEM HUMANA (STIL), 17. , 2026, Cuiabá/MT. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 476-486. DOI: https://doi.org/10.5753/stil.2026.32539.