PAIRS: Um Pipeline para Geração Automática e Curadoria de Benchmarks Text-to-SQL

  • Eduardo C. da Camara Universidade Federal do Amazonas (UFAM)
  • Jaide F. C. Zardin Universidade Federal do Amazonas (UFAM)
  • Yago Lobato Universidade Federal do Amazonas (UFAM)
  • Guilherme Fonseca Universidade Federal de Minas Gerais (UFMG)
  • Matheus Botelho Universidade Federal de Minas Gerais (UFMG)
  • Emerson A. Simoes Universidade Federal de Minas Gerais (UFMG)
  • Lucas R. Silva Universidade Federal de Minas Gerais (UFMG)
  • Pedro Calais Universidade Federal de Minas Gerais (UFMG)
  • Rodrigo Gonçalves Universidade Federal de Minas Gerais (UFMG)
  • Gustavo Ribeiro Universidade Federal de Minas Gerais (UFMG)
  • Allan Sene Dadosfera Brasil
  • Julio C. S. Reis Universidade Federal de Viçosa (UFV) https://orcid.org/0000-0003-0563-0434
  • Marcos André Gonçalves Universidade Federal de Minas Gerais (UFMG)
  • Altigran Soares da Silva Universidade Federal do Amazonas (UFAM) https://orcid.org/0000-0002-8992-495X

Resumo


Este trabalho apresenta o PAIRS (Persona-Aware Intents for Real-world SQL), um pipeline para geração automática e curadoria de pares Linguagem Natural–SQL com suporte Human-in-the-Loop, disponibilizado por meio de uma interface Web. A abordagem integra geração e validação automática de consultas SQL, síntese de perguntas condicionadas a diferentes personas, técnicas de paráfrase para ampliação da diversidade linguística e curadoria humana em um fluxo unificado. Ao simular diferentes perfis de usuários e níveis de letramento em dados, o pipeline busca produzir benchmarks Text-to-SQL semanticamente consistentes e mais próximos de cenários reais de uso. Como estudo de caso, a abordagem foi avaliada no domínio da saúde pública utilizando bases do DataSUS. Os resultados demonstram o potencial do PAIRS para apoiar a construção interativa de benchmarks especializados e aprimorar a avaliação de sistemas Text-to-SQL. A implementação do PAIRS possui código aberto disponível em repositório público, juntamente com um vídeo demonstrativo da abordagem.

Palavras-chave: Text-to-SQL, Geração de Benchmarks, Grandes Modelos de Linguagem, Bancos de Dados Específicos de Domínio, Human-in-the-loop

Referências

Coelho, G. M. C., Nascimento, E. R. S., Izquierdo, Y. T., García, G. M., Feijó, L., Lemos, M., Garcia, R. L. S., de Oliveira, A. R., Pinheiro, J. P., and Casanova, M. A. (2024). Improving the accuracy of text-to-sql tools based on large language models for real-world relational databases. In Database and Expert Systems Applications, pages 93–107.

Dragusin, C., Mirylenka, K., Czasch, C. M., Glass, M., Defosse, N., Scotton, P., and Gschwind, T. (2025). Grounding llms for database exploration: Intent scoping and paraphrasing for robust nl2sql. Proceedings of the VLDB Endowment, page 8097.

Fonseca, G., Reis, J. C. S., Botelho, M., Calais, P., Simoes, E. A., Silva, L. R., Camara, E., Zardin, J., Gonçalves, R., Ribeiro, G., Lobato, Y., Sene, A., da Silva, A., and Gonçalves, M. A. (2026). Avaliação sistemática de text-to-sql em português: Um benchmark unificado multi-domínio. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD).

Katsogiannis-Meimarakis, G. and Koutrika, G. (2023). A survey on deep learning approaches for text-to-sql. The VLDB Journal, 32(4):905–936.

Khalifat, N. (2025). Synthsql: A framework for generating synthetic text-to-sql datasets with controlled complexity. Technical report, University of Alberta.

Li, H., Zhang, J., Liu, H., Fan, J., Zhang, X., Zhu, J., Wei, R., Pan, H., Li, C., and Chen, H. (2024a). Codes: Towards building open-source language models for text-to-sql. Proc. ACM Manag. Data, 2(3).

Li, J., Hui, B., Qu, G., Yang, J., Li, B., et al. (2024b). Can llm already serve as a database interface? a big bench for large-scale database grounded text-to-sqls. NeuriPS, 36.

Wenz, F., Bouattour, O., Yang, D., Choi, J., Gregg, C., Tatbul, N., and Demiralp, Ç. (2026). Benchpress: A human-in-the-loop annotation system for rapid text-to-sql benchmark curation. In CIDR.

Yamate, B. Y., Neubauer, T. R., Fantinato, M., and Peres, S. M. (2025). Text-to-sql oriented to the process mining domain: A pt-en dataset for query translation. arXiv preprint arXiv:2509.09684.

Yu, T., Zhang, R., Yang, K., Yasunaga, M., Wang, D., Li, Z., Ma, J., Li, I., Yao, Q., Roman, S., Zhang, Z., and Radev, D. (2018). Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-SQL task. In EMNLP, pages 3911–3921.
Publicado
08/09/2026
CAMARA, Eduardo C. da et al. PAIRS: Um Pipeline para Geração Automática e Curadoria de Benchmarks Text-to-SQL. In: DEMONSTRAÇÕES E APLICAÇÕES - SIMPÓSIO BRASILEIRO DE BANCO DE DADOS (SBBD), 41. , 2026, São Carlos/SP. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 191-196. DOI: https://doi.org/10.5753/sbbd_estendido.2026.249381.