Explorando a Integração de Múltiplas Modalidades Visuais no Reconhecimento Contínuo de Libras

  • Guilherme Galvão de Oliveira Pinto Unicamp
  • Guilherme Vieira Leite Unicamp
  • Hélio Pedrini Unicamp
  • José Mario De Martino Unicamp

Resumo


O reconhecimento contínuo de Língua Brasileira de Sinais (Libras) apresenta desafios relacionados à natureza multimodal da sinalização e à modelagem de dependências espaço-temporais complexas. Este trabalho em andamento busca investigar a adaptação de arquiteturas neurais para o reconhecimento contínuo de Libras utilizando vídeos RGB, keypoints corporais, faciais e manuais, além de anotações linguísticas multi-tier produzidas no ELAN. O método proposto combina extração de características visuais, integração multimodal e modelagem temporal. A avaliação será realizada por meio da métrica Word Error Rate (WER) e estudos de ablação. Espera-se analisar o impacto da multimodalidade e das anotações multicamadas no desempenho de modelos de reconhecimento contínuo de Libras.

Referências

Alvarez, P. C., Nieto, X. G., and Benet, L. T. (2022). Sign Language Translation Based on Transformers for the How2Sign Dataset. Image Processing Group Signal Theory and Communications Department Universitat Politècnica de Catalunya.

Bragg, D., Koller, O., Bellard, M., Berke, L., Boudreault, P., Braffort, A., Caselli, N., Huenerfauth, M., Kacorri, H., Verhoef, T., et al. (2019). Sign Language Recognition, Generation, and Translation: An Interdisciplinary Perspective. In Proceedings of the 21st International ACM SIGACCESS Conference on Computers and Accessibility, pages 16–31.

Camgoz, N. C., Hadfield, S., Koller, O., Ney, H., and Bowden, R. (2018). Neural Sign Language Translation. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pages 7784–7793.

Camgoz, N. C., Koller, O., Hadfield, S., and Bowden, R. (2020a). Multi-Channel Transformers for Multi-Articulatory Sign Language Translation. In European Conference on Computer Vision, pages 301–319. Springer.

Camgoz, N. C., Koller, O., Hadfield, S., and Bowden, R. (2020b). Sign Language Transformers: Joint End-To-End Sign Language Recognition and Translation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 10023–10033.

Khan, A., Jin, S., Lee, G.-H., Arzu, G. E., Dang, L. M., Nguyen, T. N., Choi, W., and Moon, H. (2025). Deep Learning Approaches for Continuous Sign Language Recognition: A Comprehensive Review. IEEE Access, 13:55524–55544.

Koller, O., Forster, J., and Ney, H. (2015). Continuous Sign Language Recognition: Towards Large Vocabulary Statistical Recognition Systems Handling Multiple Signers. Computer Vision and Image Understanding, 141:108–125.

Najib, F. M. (2025). Sign Language Interpretation using Machine Learning and Artificial Intelligence. Neural Computing and Applications, 37(2):841–857.

Presidência da República (2002). Lei número 10.436. Diário Oficial da União, Imprensa Nacional, n. 79, Seção 1.

Presidência da República (2015). Lei número 13.146, de 6 de julho de 2015. Institui a Lei Brasileira de Inclusão da Pessoa com Deficiência (Estatuto da Pessoa com Deficiência). Diário Oficial da União, Brasília, DF.

Wang, Z., Li, D., Jiang, R., and Okumura, M. (2025). Continuous Sign Language Recognition with Multi-Scale Spatial-Temporal Feature Enhancement. IEEE Access, 13:5491–5506.

Wittenburg, P., Brugman, H., Russel, A., Klassmann, A., and Sloetjes, H. (2006). ELAN: A Professional Framework for Multimodality Research. In 5th International Conference on Language Resources and Evaluation, pages 1556–1559.

Yin, A., Zhong, T., Tang, L., Jin, W., Jin, T., and Zhao, Z. (2023). Gloss Attention for Gloss-Free Sign Language Translation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern rRecognition, pages 2551–2562.

Yin, K. and Read, J. (2020). Better Sign Language Translation with STMC-Transformer. In Proceedings of the 28th International Conference on Computational Linguistics, pages 5975–5989.
Publicado
19/10/2026
PINTO, Guilherme Galvão de Oliveira; LEITE, Guilherme Vieira; PEDRINI, Hélio; MARTINO, José Mario De. Explorando a Integração de Múltiplas Modalidades Visuais no Reconhecimento Contínuo de Libras. In: SIMPÓSIO BRASILEIRO DE TECNOLOGIA DA INFORMAÇÃO E DA LINGUAGEM HUMANA (STIL), 17. , 2026, Cuiabá/MT. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 594-599. DOI: https://doi.org/10.5753/stil.2026.29828.