MIST-Saúde: Uma Ferramenta Flexível de Imputação Semântica de Dados Clínicos Tabulares

  • Arthur Henrique Quaresma UFMG
  • Caio Fabri UFMG
  • Davi Augusto Rodrigues UFMG
  • Izadora Ganem UFMG
  • Guilherme Dal Bianco UFFS
  • José Carlos Serufo Filho UFMG
  • Leonardo Rocha UFSJ
  • Milena Marcolino UFMG
  • Marcos André Gonçalves UFMG

Resumo


Valores ausentes em dados clínicos degradam a performance de modelos e comprometem decisões. Este trabalho apresenta o MIST-Saúde, uma ferramenta demonstrável de imputação semântica de dados tabulares clínicos. A ferramenta integra métodos estatísticos e abordagens semânticas com modelos fundacionais pré-treinados (ex.: TabPFN), combinados em ensemble para robustez frente a drifts temporais. O MIST-Saúde é entregue como biblioteca Python com Docker, API REST em FastAPI e interface web para configuração, execução e exportação dos resultados. Relatamos motivação, stakeholders, processo de desenvolvimento, elicitação e requisitos, além do desenho do módulo. Como o trabalho segue em construção, a arquitetura detalhada, as tecnologias finais e a bateria completa de testes ainda estão sendo consolidadas; ainda assim, há um protótipo e um vídeo de instalação disponíveis para demonstração.
Palavras-chave: Imputação de dados, Inteligência Artificial, Saúde, Modelos Fundacionais, Drifts Temporais, Ensemble

Referências

Cohn, M. (2005). Agile Estimating and Planning. Prentice Hall.

Emmanuel, T. et al. (2021). A survey on missing data in machine learning. Journal of Big Data, 8:1–37.

Ganem, I. M., Bianco, G. D., Serufo Filho, J. C., Lima, L., Rocha, L., and Gonçalves, M. A. (2025). Avaliando as limitações e potenciais do algoritmo k-vizinhos mais próximos (knn) na imputação de dados clínicos. In Simpósio Brasileiro de Banco de Dados (SBBD), pages 809–815. SBC.

Hollmann, N., Müller, S., Purucker, L., Krishnakumar, A., Körfer, M., Hoo, S. B., Schirrmeister, R. T., and Hutter, F. (2025). Accurate predictions on small data with a tabular foundation model. Nature, 637:319–326.

Lana, F. C. B. et al. (2025). Unraveling relevant cross-waves pattern drifts in patient-hospital risk factors among hospitalized covid-19 patients. BMC Infectious Diseases, 25(1):537.

Marcolino, M. S. et al. (2021). Clinical characteristics and outcomes of patients hospitalized with covid-19 in brazil. International Journal of Infectious Diseases, 107:300–310.

Marcolino, M. S., Schettini, I., do Nascimento, G., da Rocha, L., Lana, F., and Gonçalves, M. A. (2025). Explainable artificial intelligence for predicting cardiovascular events in hospitalised covid-19 patients. BMC Infectious Diseases, 25(1):1569.

Paiva, B. B. M. et al. (2023). Potential and limitations of machine meta-learning methods for predicting covid-19 mortality. Scientific Reports, 13(1):3463.

Paiva, B. B. M., Pereira, P. D., Gomes, V. M. R., Silva, M. V. R. S., Valiense, C., Marcolino, M. S., and Gonçalves, M. A. (2022). Characterizing and understanding temporal effects in covid-19 data. In Proceedings of Machine Learning Research, volume 184 of Proc. of Mach. Learn. Research, pages 33–40.

Schwaber, K. and Sutherland, J. (2020). The scrum guide. Scrum.org. The Definitive Guide to Scrum: The Rules of the Game.
Publicado
01/06/2026
QUARESMA, Arthur Henrique et al. MIST-Saúde: Uma Ferramenta Flexível de Imputação Semântica de Dados Clínicos Tabulares. In: FERRAMENTAS E APLICAÇÕES - SIMPÓSIO BRASILEIRO DE COMPUTAÇÃO APLICADA À SAÚDE (SBCAS), 26. , 2026, Ouro Preto/MG. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 168-173. ISSN 2763-8987. DOI: https://doi.org/10.5753/sbcas_estendido.2026.21282.