JABUTI-SQL: Um Benchmark em Português para Avaliação de Abordagens Text-to-SQL em Cenários Reais
Resumo
This paper presents JABUTI-SQL (Joint Annotated Benchmark for User-centric Text-to-SQL In Real Health Data), a Brazilian benchmark for Text-to-SQL built from real public healthcare data provided by DATASUS, the Brazilian public health data platform. The benchmark integrates multiple heterogeneous sources related to pharmaceutical assistance, public procurement, hospital infrastructure, and regional healthcare organization into a unified relational schema. Unlike synthetic benchmarks, JABUTI-SQL preserves characteristics commonly found in real governmental databases, including incomplete records, semantic inconsistencies, heterogeneous structures, and complex inter-table relations. The benchmark contains 69 Portuguese question–SQL pairs covering three user personas and multiple difficulty levels, aiming to support the evaluation of Text-to-SQL systems under more realistic conditions.
Palavras-chave:
Text-to-SQL, DATASUS, Conjunto de Dados, Processamento de Linguagem Natural, Saúde Pública, Banco de Dados Relacional
Referências
Camara, E., Zardin, J., Lobato, Y., Fonseca, G., Botelho, M., Simoes, E. A., Silva, L. R., Calais, P., Gonçalves, R., Ribeiro, G., Sene, A., Reis, J. C. S., Gonçalves, M. A., and da Silva, A. (2026). Pairs: Um pipeline para geração automática e curadoria de benchmarks text-to-sql. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD) – Demonstrations.
Dou, L., Gao, Y., Pan, M., Wang, D., Che, W., Zhan, D., and Lou, J.-G. (2023). Multispider: towards benchmarking multilingual text-to-sql semantic parsing. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 37, pages 12745–12753.
Finkelstein, B. J. and Borges Junior, L. H. (2020). A capacidade de leitos hospitalares no Brasil, as internações no SUS, a migração demográfica e os custos dos procedimentos. Jornal Brasileiro de Economia da Saúde, 12(3):273–280.
Fonseca, G., Reis, J. C. S., Botelho, M., Calais, P., Simoes, E. A., Silva, L. R., Camara, E., Zardin, J., Gonçalves, R., Ribeiro, G., Lobato, Y., Sene, A., da Silva, A., and Gonçalves, M. A. (2026). Avaliação sistemática de text-to-sql em português: Um benchmark unificado multi-domínio. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD).
Fróes, K. d. C. and Braghetto, K. R. (2025). Exploring temporal text-to-sql challenges in brazilian portuguese: Lessons from educational data. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD), pages 963–969.
Gamarski, R., Castro, F. F. d., Nascimento, J. A. S. d., and Abreu, M. M. d. (2025). A frequência de doenças cardiovasculares na artrite reumatoide no brasil: Estudo de coorte de 10 anos com bancos de dados do DATASUS. Arquivos Brasileiros de Cardiologia, 122(2):e20240313.
Hong, Z., Yuan, Z., et al. (2024). Next-generation database interfaces: A survey of llm-based text-to-sql. arXiv preprint arXiv:2406.08426.
José, M. A. and Cozman, F. G. (2023). A multilingual translator to sql with database schema pruning to improve self-attention. In International Journal of Information Technology, pages 3015–3023.
Katsogiannis-Meimarakis, G. and Koutrika, G. (2023). A survey on deep learning approaches for text-to-sql. The VLDB Journal, 32(4):905–936.
Li, J., Hui, B., Qu, G., Yang, J., Li, B., Li, B., Wang, B., Qin, B., Geng, R., Huo, N., et al. (2023). Can llm already serve as a database interface? a big bench for large-scale database grounded text-to-sqls. Advances in Neural Information Processing Systems, 36:42330–42357.
Moraes, M., Figueiredo, I., Marques, V., Santos, J., and Manssour, I. H. (2025). From questions to answers: A natural language interface for datasus hospitalization data. In Escola Regional de Aprendizado de Máquina e Inteligência Artificial da Região Sul (ERAMIA-RS), pages 296–299.
Pedroso, B. C., Pereira, M. R., and Pereira, D. A. (2025). Performance evaluation of llms in the text-to-sql task in portuguese. In Simpósio Brasileiro de Sistemas de Informação (SBSI), pages 260–269.
Pourreza, M. and Rafiei, D. (2023). Din-sql: Decomposed in-context learning of text-to-sql with self-correction. Advances in neural information processing systems, 36:36339–36348.
Silva, W. R. O. d., Cavalcanti, I. T. d. N., Peters, J. R., Ferreira, L. E. M. d. S., Santana, R. S., and Leite, S. N. (2025). Preços pagos pelos medicamentos para atenção primária pelos municípios brasileiros. Revista de Saúde Pública, 59:1–15.
Yu, T., Zhang, R., Yang, K., Yasunaga, M., Wang, D., Li, Z., Ma, J., Li, I., Yao, Q., Roman, S., et al. (2018). Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task. In Proceedings of the conference on empirical methods in natural language processing (EMNLP), pages 3911–3921.
Dou, L., Gao, Y., Pan, M., Wang, D., Che, W., Zhan, D., and Lou, J.-G. (2023). Multispider: towards benchmarking multilingual text-to-sql semantic parsing. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 37, pages 12745–12753.
Finkelstein, B. J. and Borges Junior, L. H. (2020). A capacidade de leitos hospitalares no Brasil, as internações no SUS, a migração demográfica e os custos dos procedimentos. Jornal Brasileiro de Economia da Saúde, 12(3):273–280.
Fonseca, G., Reis, J. C. S., Botelho, M., Calais, P., Simoes, E. A., Silva, L. R., Camara, E., Zardin, J., Gonçalves, R., Ribeiro, G., Lobato, Y., Sene, A., da Silva, A., and Gonçalves, M. A. (2026). Avaliação sistemática de text-to-sql em português: Um benchmark unificado multi-domínio. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD).
Fróes, K. d. C. and Braghetto, K. R. (2025). Exploring temporal text-to-sql challenges in brazilian portuguese: Lessons from educational data. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD), pages 963–969.
Gamarski, R., Castro, F. F. d., Nascimento, J. A. S. d., and Abreu, M. M. d. (2025). A frequência de doenças cardiovasculares na artrite reumatoide no brasil: Estudo de coorte de 10 anos com bancos de dados do DATASUS. Arquivos Brasileiros de Cardiologia, 122(2):e20240313.
Hong, Z., Yuan, Z., et al. (2024). Next-generation database interfaces: A survey of llm-based text-to-sql. arXiv preprint arXiv:2406.08426.
José, M. A. and Cozman, F. G. (2023). A multilingual translator to sql with database schema pruning to improve self-attention. In International Journal of Information Technology, pages 3015–3023.
Katsogiannis-Meimarakis, G. and Koutrika, G. (2023). A survey on deep learning approaches for text-to-sql. The VLDB Journal, 32(4):905–936.
Li, J., Hui, B., Qu, G., Yang, J., Li, B., Li, B., Wang, B., Qin, B., Geng, R., Huo, N., et al. (2023). Can llm already serve as a database interface? a big bench for large-scale database grounded text-to-sqls. Advances in Neural Information Processing Systems, 36:42330–42357.
Moraes, M., Figueiredo, I., Marques, V., Santos, J., and Manssour, I. H. (2025). From questions to answers: A natural language interface for datasus hospitalization data. In Escola Regional de Aprendizado de Máquina e Inteligência Artificial da Região Sul (ERAMIA-RS), pages 296–299.
Pedroso, B. C., Pereira, M. R., and Pereira, D. A. (2025). Performance evaluation of llms in the text-to-sql task in portuguese. In Simpósio Brasileiro de Sistemas de Informação (SBSI), pages 260–269.
Pourreza, M. and Rafiei, D. (2023). Din-sql: Decomposed in-context learning of text-to-sql with self-correction. Advances in neural information processing systems, 36:36339–36348.
Silva, W. R. O. d., Cavalcanti, I. T. d. N., Peters, J. R., Ferreira, L. E. M. d. S., Santana, R. S., and Leite, S. N. (2025). Preços pagos pelos medicamentos para atenção primária pelos municípios brasileiros. Revista de Saúde Pública, 59:1–15.
Yu, T., Zhang, R., Yang, K., Yasunaga, M., Wang, D., Li, Z., Ma, J., Li, I., Yao, Q., Roman, S., et al. (2018). Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task. In Proceedings of the conference on empirical methods in natural language processing (EMNLP), pages 3911–3921.
Publicado
08/09/2026
Como Citar
BOTELHO, Matheus et al.
JABUTI-SQL: Um Benchmark em Português para Avaliação de Abordagens Text-to-SQL em Cenários Reais. In: DATASET SHOWCASE WORKSHOP (DSW), 8. , 2026, São Carlos/SP.
Anais [...].
Porto Alegre: Sociedade Brasileira de Computação,
2026
.
p. 126-137.
DOI: https://doi.org/10.5753/dsw.2026.249611.
