JABUTI-SQL: Um Benchmark em Português para Avaliação de Abordagens Text-to-SQL em Cenários Reais

  • Matheus Botelho Universidade Federal de Minas Gerais (UFMG)
  • Guilherme Fonseca Universidade Federal de Minas Gerais (UFMG)
  • Lucas R. Silva Universidade Federal de Minas Gerais (UFMG)
  • Rodrigo M. Gonçalves Universidade Federal de Minas Gerais (UFMG)
  • Yago Lobato Universidade Federal de Minas Gerais (UFMG)
  • Gustavo A. Ribeiro Universidade Federal de Minas Gerais (UFMG)
  • Eduardo C. de Camara Universidade Federal do Amazonas (UFAM)
  • Jaide F. C. Zardin Universidade Federal do Amazonas (UFAM)
  • Pedro Calais Universidade Federal de Minas Gerais (UFMG)
  • Emerson A. Simoes Universidade Federal de Minas Gerais (UFMG)
  • Allan Sene Dadosfera Brasil
  • Julio C. S. Reis Universidade Federal de Viçosa (UFV) http://orcid.org/0000-0003-0563-0434
  • Altigran da Silva Universidade Federal do Amazonas (UFAM) http://orcid.org/0000-0002-8992-495X
  • Marcos André Gonçalves Universidade Federal de Minas Gerais (UFMG)

Resumo


This paper presents JABUTI-SQL (Joint Annotated Benchmark for User-centric Text-to-SQL In Real Health Data), a Brazilian benchmark for Text-to-SQL built from real public healthcare data provided by DATASUS, the Brazilian public health data platform. The benchmark integrates multiple heterogeneous sources related to pharmaceutical assistance, public procurement, hospital infrastructure, and regional healthcare organization into a unified relational schema. Unlike synthetic benchmarks, JABUTI-SQL preserves characteristics commonly found in real governmental databases, including incomplete records, semantic inconsistencies, heterogeneous structures, and complex inter-table relations. The benchmark contains 69 Portuguese question–SQL pairs covering three user personas and multiple difficulty levels, aiming to support the evaluation of Text-to-SQL systems under more realistic conditions.
Palavras-chave: Text-to-SQL, DATASUS, Conjunto de Dados, Processamento de Linguagem Natural, Saúde Pública, Banco de Dados Relacional

Referências

Camara, E., Zardin, J., Lobato, Y., Fonseca, G., Botelho, M., Simoes, E. A., Silva, L. R., Calais, P., Gonçalves, R., Ribeiro, G., Sene, A., Reis, J. C. S., Gonçalves, M. A., and da Silva, A. (2026). Pairs: Um pipeline para geração automática e curadoria de benchmarks text-to-sql. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD) – Demonstrations.

Dou, L., Gao, Y., Pan, M., Wang, D., Che, W., Zhan, D., and Lou, J.-G. (2023). Multispider: towards benchmarking multilingual text-to-sql semantic parsing. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 37, pages 12745–12753.

Finkelstein, B. J. and Borges Junior, L. H. (2020). A capacidade de leitos hospitalares no Brasil, as internações no SUS, a migração demográfica e os custos dos procedimentos. Jornal Brasileiro de Economia da Saúde, 12(3):273–280.

Fonseca, G., Reis, J. C. S., Botelho, M., Calais, P., Simoes, E. A., Silva, L. R., Camara, E., Zardin, J., Gonçalves, R., Ribeiro, G., Lobato, Y., Sene, A., da Silva, A., and Gonçalves, M. A. (2026). Avaliação sistemática de text-to-sql em português: Um benchmark unificado multi-domínio. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD).

Fróes, K. d. C. and Braghetto, K. R. (2025). Exploring temporal text-to-sql challenges in brazilian portuguese: Lessons from educational data. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD), pages 963–969.

Gamarski, R., Castro, F. F. d., Nascimento, J. A. S. d., and Abreu, M. M. d. (2025). A frequência de doenças cardiovasculares na artrite reumatoide no brasil: Estudo de coorte de 10 anos com bancos de dados do DATASUS. Arquivos Brasileiros de Cardiologia, 122(2):e20240313.

Hong, Z., Yuan, Z., et al. (2024). Next-generation database interfaces: A survey of llm-based text-to-sql. arXiv preprint arXiv:2406.08426.

José, M. A. and Cozman, F. G. (2023). A multilingual translator to sql with database schema pruning to improve self-attention. In International Journal of Information Technology, pages 3015–3023.

Katsogiannis-Meimarakis, G. and Koutrika, G. (2023). A survey on deep learning approaches for text-to-sql. The VLDB Journal, 32(4):905–936.

Li, J., Hui, B., Qu, G., Yang, J., Li, B., Li, B., Wang, B., Qin, B., Geng, R., Huo, N., et al. (2023). Can llm already serve as a database interface? a big bench for large-scale database grounded text-to-sqls. Advances in Neural Information Processing Systems, 36:42330–42357.

Moraes, M., Figueiredo, I., Marques, V., Santos, J., and Manssour, I. H. (2025). From questions to answers: A natural language interface for datasus hospitalization data. In Escola Regional de Aprendizado de Máquina e Inteligência Artificial da Região Sul (ERAMIA-RS), pages 296–299.

Pedroso, B. C., Pereira, M. R., and Pereira, D. A. (2025). Performance evaluation of llms in the text-to-sql task in portuguese. In Simpósio Brasileiro de Sistemas de Informação (SBSI), pages 260–269.

Pourreza, M. and Rafiei, D. (2023). Din-sql: Decomposed in-context learning of text-to-sql with self-correction. Advances in neural information processing systems, 36:36339–36348.

Silva, W. R. O. d., Cavalcanti, I. T. d. N., Peters, J. R., Ferreira, L. E. M. d. S., Santana, R. S., and Leite, S. N. (2025). Preços pagos pelos medicamentos para atenção primária pelos municípios brasileiros. Revista de Saúde Pública, 59:1–15.

Yu, T., Zhang, R., Yang, K., Yasunaga, M., Wang, D., Li, Z., Ma, J., Li, I., Yao, Q., Roman, S., et al. (2018). Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task. In Proceedings of the conference on empirical methods in natural language processing (EMNLP), pages 3911–3921.
Publicado
08/09/2026
BOTELHO, Matheus et al. JABUTI-SQL: Um Benchmark em Português para Avaliação de Abordagens Text-to-SQL em Cenários Reais. In: DATASET SHOWCASE WORKSHOP (DSW), 8. , 2026, São Carlos/SP. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 126-137. DOI: https://doi.org/10.5753/dsw.2026.249611.