Um Estudo sobre Melhorias na Qualidade dos Dados para Análises no Domínio da Saúde

  • Júlia Nakayama Silveira UFSC
  • Ronaldo dos Santos Mello UFSC

Resumo


A heterogeneidade, fragmentação e uso secundário de dados clínicos tornam a qualidade de dados um requisito central para análises avançadas e aplicações de inteligência artificial em saúde. Este artigo apresenta um estudo sobre melhorias na qualidade de dados visando análises mais efetivas sobre esses dados, considerando o domínio de Saúde. O estudo inclui uma revisão sistemática da literatura para identificar estratégias, dimensões/métricas, tecnologias, desafios e resultados associados à avaliação e melhoria da qualidade de dados do domínio, seguido de uma visão geral e uma análise comparativa dos trabalhos encontrados. Os resultados do estudo indicam convergência no uso de dimensões clássicas, como completude e acurácia, e de indicadores agregados para mensuração comparável. Observa-se também a evolução tecnológica de dashboards e frameworks de validação para soluções baseadas em aprendizado de máquina, monitoramento em tempo real e abordagens emergentes que utilizam LLM e aprendizado federado.

Referências

Benkherourou, C. and Bourouis, A. (2025). A framework to enhance data quality in master data management process: a healthcare study. ITEGAM-JETIA, 11(55):204–211.

Berman, L., Ostchega, Y., Giannini, J., Anandan, L. P., Clark, E., Spotnitz, M., Sulieman, L., Volynski, M., and Ramirez, A. (2024). Application of a data quality framework to ductal carcinoma in situ using electronic health record data from the all of us research program. JCO Clinical Cancer Informatics, 8:e2400052.

Diaz-Garelli, J.-F., Bernstam, E. V., Lee, M., Hwang, K. O., Rahbar, M. H., and Johnson, T. R. (2019). Datagauge: A practical process for systematically designing and implementing quality assessments of repurposed clinical data. eGEMs (Generating Evidence & Methods to improve patient outcomes), 7(1):32.

Ehsani-Moghaddam, B. et al. (2021). Data quality in healthcare: a report of practical experience with the canadian primary care sentinel surveillance network. Health Information Management Journal, 50(1-2):88–92.

Fernandes, M., Donahue, M. A., Hoch, D., Cash, S., Zafar, S., Jacobs, C., Hosford, M., Voinescu, P. E., Fureman, B., Buchhalter, J., McGraw, C. M., Westover, M. B., and Moura, L. M. V. R. (2022). A replicable, open-source, data integration method to support national practice-based research & quality improvement systems. Epilepsy Research, 186:107013.

Goldstein, N. D., Kahal, D., Testa, K., Gracely, E. J., and Burstyn, I. (2022). Data quality in electronic health record research: An approach for validation and quantitative bias analysis for imperfectly ascertained health outcomes via diagnostic codes. Harvard Data Science Review, (4.2).

Griffiths, E. J. et al. (2024). Pha4ge quality control contextual data tags: standardized annotations for sharing public health sequence datasets with known quality issues to facilitate testing and training. Microbial Genomics, 10:001260.

Hall, J. M. M., Pham, D., Nguyen, T. V., VerMilyea, M., Lynn, R., Diakiw, S. M., and Perugini, M. (2021). Untrainable data cleansing for ai in healthcare. Scientific Reports, 11.

Jarmakovica, A. (2025). Machine learning-based strategies for improving healthcare data quality: an evaluation of accuracy, completeness, and reusability. Frontiers in Artificial Intelligence, 8:1621514.

Jeon, K.-C., Han, G.-S., Han, C.-Y., and Chong, I. (2023). Federated learning model for contextual sensitive data quality applications: Healthcare use case. In SmartCore; Hankuk University of Foreign Studies. IEEE.

Joshi, A., Mazaitis, K., Rosenfeld, R., and Wilder, B. (2023). Computationally assisted quality control for public health data streams. Carnegie Mellon University.

Kaloyanova, K., Naydenova, I., and Kovacheva, Z. (2021). Addressing data quality in healthcare. In CEUR Workshop Proceedings, volume 2933, pages 156–164.

Kamal, M. M., Kutafina, E., and Beyan, O. (2025). Real-time automated monitoring architecture for ensuring quality etl processes in healthcare data: A case study from cologne university hospital’s medical data integration center. In Intelligent Health Systems, pages 192–197. IOS Press.

Kim, K.-H., Choi, W., Ko, S.-J., Chang, D.-J., Chung, Y.-W., Chang, S.-H., Kim, J.-K., Kim, D.-J., and Choi, I.-Y. (2021). Multi-center healthcare data quality measurement model and assessment using omop cdm. Applied Sciences, 11(19):9188.

Kitchenham, B. (2004). Procedures for Performing Systematic Reviews. Keele University.

Maity, D., Satish, R., Jadeja, D. A., Dharmaraju, R., Chandru, V., Sundaresan, R., Singh, H., and Pal, D. (2024). Midas: a new platform for quality-graded health data for ai-enabled healthcare in india. Nature Medicine.

Marteau, B. L., Hornback, A., Zhong, Y., Lowson, C., Woloff, J., Smith, B. M., Hilton, C., and Wang, M. D. (2025). Improving a large healthcare system research data warehouse using ohdsi’s data quality dashboard. In Intelligent Health Systems. Georgia Institute of Technology; Shriners Hospitals for Children.

Monteiro, S., Oliveira, B., Elvas, L., and Ferreira, J. (2025). Improving healthcare data quality: A case study in a portuguese hospital. Procedia Computer Science, 256:1030–1038.

Nasir, W. M. H. M., Abdullah, R., Jusoh, Y. Y., and Abdullah, S. (2022). Big data analytics quality in enhancing healthcare organizational performance: A conceptual model development. International Journal of Advanced Computer Science and Applications, 13(11).

Olaniyan, F. M. A. and Owoseni, A. (2022). Toward improved data quality in public health: Analysis of anomaly detection tools applied to hiv/aids data in africa. In IST-Africa 2022 Conference Proceedings.

Romero, L., Carneiro, P. B., Riley, C., Clark, H., Uy, R., Park, M., Mawokomatanda, T., Bombard, J. M., Hinckley, A., and Skapik, J. (2022). Building capacity of community health centers to overcome data challenges with the development of an agile covid-19 public health registry: a multistate quality improvement effort. Journal of the American Medical Informatics Association, 29(1):80–88.

Sendak, M. et al. (2022). Development and validation of ml-dqa – a machine learning data quality assurance framework for healthcare. Proceedings of Machine Learning Research, 182:1–19.

Shahnawaz, M. and Kumar, M. (2025). A comprehensive survey on big data analytics: characteristics, tools and techniques. ACM Computing Surveys, 57(8):1–33.

Shobha, K. and Savarimuthu, N. (2021). Clustering based imputation algorithm using unsupervised neural network for enhancing the quality of healthcare data. Journal of Ambient Intelligence and Humanized Computing, 12:1771–1781.

Thuraisingam, S., Manski-Nankervis, J.-A., Choong, P., and Dowsey, M. (2021). Suitability of general practice electronic health records for clinical prediction model development. BMC Medical Informatics and Decision Making, 21:297.

Wang, H., Belitskaya-Levy, I., Wu, F., Lee, J. S., Shih, M.-C., Tsao, P. S., and Lu, Y. (2021). A statistical quality assessment method for longitudinal observations in electronic health record data with an application to the va million veteran program. BMC Medical Informatics and Decision Making, 21:289.

Xie, S., Cai, H., Sun, Y., and Lv, X. (2025). Llm-dqr: Large language model-based automated generation of data quality rules for electronic health records. Journal of Biomedical Informatics, 172:104951.
Publicado
22/04/2026
SILVEIRA, Júlia Nakayama; MELLO, Ronaldo dos Santos. Um Estudo sobre Melhorias na Qualidade dos Dados para Análises no Domínio da Saúde. In: ESCOLA REGIONAL DE BANCO DE DADOS (ERBD), 21. , 2026, Dois Vizinhos/PR. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 29-38. ISSN 2595-413X. DOI: https://doi.org/10.5753/erbd.2026.20724.