The Missing Pieces in Classical and Modern Data Error Classification
Resumo
Data quality research has produced extensive catalogs of data error types and data quality problems. However, gaps remain when contrasting classical taxonomies with recent consolidated surveys. This paper identifies three categories of data errors that are insufficiently captured in both foundational and contemporary works: ambiguous abbreviation values, intra-tuple dependency violations based on reference semantics, and cross-source unit inconsistencies. We provide formal definitions for each error type, illustrate them with representative examples, and discuss practical considerations for their detection in real-world scenarios. Our contributions help bridge classical data quality literature with modern data integration challenges, supporting a more comprehensive assessment of data quality in heterogeneous environments.
Palavras-chave:
Data quality, Data errors, Data quality taxonomies, Data integration, Heterogeneous data
Referências
Abedjan, Z., Chu, X., Deng, D., Fernandez, R. C., Ilyas, I. F., Ouzzani, M., Papotti, P., Stonebraker, M., and Tang, N. (2016). Detecting data errors: Where are we and what needs to be done? Proceedings of the VLDB Endowment, 9(12):993–1004.
Batini, C., Cappiello, C., Francalanci, C., and Maurino, A. (2009). Methodologies for data quality assessment and improvement. ACM Computing Surveys, 41(3):Article 16.
Batini, C. and Scannapieco, M. (2024). Data Quality: Concepts, Methodologies and Techniques. Springer, second edition.
Bhadauria, D., Harmouch, H., Naumann, F., Srivastava, D., and Ehrlinger, L. (2026). A catalog of data errors. arXiv preprint arXiv:2604.09277.
Date, C. J. (2005). Database in depth: relational theory for practitioners. ”O’Reilly Media, Inc.”.
Ehrlinger, L. and Wöß, W. (2022). A survey of data quality measurement and monitoring tools. Frontiers in Big Data, 5:850611.
Kim, W., Choi, B.-J., Hong, E.-K., Kim, S.-K., and Lee, D. (2003). A taxonomy of dirty data. Data Mining and Knowledge Discovery, 7(1):81–99.
Müller, H. and Freytag, J. C. (2005). Problems, methods, and challenges in comprehensive data cleansing. Technical Report HUB-IB-164, Humboldt University, Berlin.
Nascimento, D. C., da Silva, D., and Pereira, L. F. A. (2025). Análise teórica do impacto de dados faltantes em atributos sensíveis sobre a métrica de fairness p%-rule. In Simpósio Brasileiro de Banco de Dados (SBBD), pages 767–773. SBC.
Oliveira, P., Rodrigues, F., and Henriques, P. R. (2005a). A formal definition of data quality problems. In Proceedings of the International Conference on Information Quality (ICIQ).
Oliveira, P., Rodrigues, F., Henriques, P. R., and Galhardas, H. (2005b). A taxonomy of data quality problems. In Proceedings of the 2nd International Workshop on Data and Information Quality, pages 219–233.
Rahm, E. and Do, H. H. (2000). Data cleaning: Problems and current approaches. IEEE Bulletin of the Technical Committee on Data Engineering, 23(4):3–13.
Zhang, S., Huang, Z., and Wu, E. (2025). Data cleaning using large language models. In Proceedings of the International Conference on Data Engineering (ICDE), pages 28–32.
Batini, C., Cappiello, C., Francalanci, C., and Maurino, A. (2009). Methodologies for data quality assessment and improvement. ACM Computing Surveys, 41(3):Article 16.
Batini, C. and Scannapieco, M. (2024). Data Quality: Concepts, Methodologies and Techniques. Springer, second edition.
Bhadauria, D., Harmouch, H., Naumann, F., Srivastava, D., and Ehrlinger, L. (2026). A catalog of data errors. arXiv preprint arXiv:2604.09277.
Date, C. J. (2005). Database in depth: relational theory for practitioners. ”O’Reilly Media, Inc.”.
Ehrlinger, L. and Wöß, W. (2022). A survey of data quality measurement and monitoring tools. Frontiers in Big Data, 5:850611.
Kim, W., Choi, B.-J., Hong, E.-K., Kim, S.-K., and Lee, D. (2003). A taxonomy of dirty data. Data Mining and Knowledge Discovery, 7(1):81–99.
Müller, H. and Freytag, J. C. (2005). Problems, methods, and challenges in comprehensive data cleansing. Technical Report HUB-IB-164, Humboldt University, Berlin.
Nascimento, D. C., da Silva, D., and Pereira, L. F. A. (2025). Análise teórica do impacto de dados faltantes em atributos sensíveis sobre a métrica de fairness p%-rule. In Simpósio Brasileiro de Banco de Dados (SBBD), pages 767–773. SBC.
Oliveira, P., Rodrigues, F., and Henriques, P. R. (2005a). A formal definition of data quality problems. In Proceedings of the International Conference on Information Quality (ICIQ).
Oliveira, P., Rodrigues, F., Henriques, P. R., and Galhardas, H. (2005b). A taxonomy of data quality problems. In Proceedings of the 2nd International Workshop on Data and Information Quality, pages 219–233.
Rahm, E. and Do, H. H. (2000). Data cleaning: Problems and current approaches. IEEE Bulletin of the Technical Committee on Data Engineering, 23(4):3–13.
Zhang, S., Huang, Z., and Wu, E. (2025). Data cleaning using large language models. In Proceedings of the International Conference on Data Engineering (ICDE), pages 28–32.
Publicado
08/09/2026
Como Citar
NASCIMENTO, Dimas Cassimiro; SILVA, Daliton da.
The Missing Pieces in Classical and Modern Data Error Classification. In: SIMPÓSIO BRASILEIRO DE BANCO DE DADOS (SBBD), 41. , 2026, São Carlos/SP.
Anais [...].
Porto Alegre: Sociedade Brasileira de Computação,
2026
.
p. 847-853.
ISSN 2763-8979.
DOI: https://doi.org/10.5753/sbbd.2026.249431.
