PAIRS: Um Pipeline para Geração Automática e Curadoria de Benchmarks Text-to-SQL
Resumo
Este trabalho apresenta o PAIRS (Persona-Aware Intents for Real-world SQL), um pipeline para geração automática e curadoria de pares Linguagem Natural–SQL com suporte Human-in-the-Loop, disponibilizado por meio de uma interface Web. A abordagem integra geração e validação automática de consultas SQL, síntese de perguntas condicionadas a diferentes personas, técnicas de paráfrase para ampliação da diversidade linguística e curadoria humana em um fluxo unificado. Ao simular diferentes perfis de usuários e níveis de letramento em dados, o pipeline busca produzir benchmarks Text-to-SQL semanticamente consistentes e mais próximos de cenários reais de uso. Como estudo de caso, a abordagem foi avaliada no domínio da saúde pública utilizando bases do DataSUS. Os resultados demonstram o potencial do PAIRS para apoiar a construção interativa de benchmarks especializados e aprimorar a avaliação de sistemas Text-to-SQL. A implementação do PAIRS possui código aberto disponível em repositório público, juntamente com um vídeo demonstrativo da abordagem.
Referências
Dragusin, C., Mirylenka, K., Czasch, C. M., Glass, M., Defosse, N., Scotton, P., and Gschwind, T. (2025). Grounding llms for database exploration: Intent scoping and paraphrasing for robust nl2sql. Proceedings of the VLDB Endowment, page 8097.
Fonseca, G., Reis, J. C. S., Botelho, M., Calais, P., Simoes, E. A., Silva, L. R., Camara, E., Zardin, J., Gonçalves, R., Ribeiro, G., Lobato, Y., Sene, A., da Silva, A., and Gonçalves, M. A. (2026). Avaliação sistemática de text-to-sql em português: Um benchmark unificado multi-domínio. In Anais do Simpósio Brasileiro de Banco de Dados (SBBD).
Katsogiannis-Meimarakis, G. and Koutrika, G. (2023). A survey on deep learning approaches for text-to-sql. The VLDB Journal, 32(4):905–936.
Khalifat, N. (2025). Synthsql: A framework for generating synthetic text-to-sql datasets with controlled complexity. Technical report, University of Alberta.
Li, H., Zhang, J., Liu, H., Fan, J., Zhang, X., Zhu, J., Wei, R., Pan, H., Li, C., and Chen, H. (2024a). Codes: Towards building open-source language models for text-to-sql. Proc. ACM Manag. Data, 2(3).
Li, J., Hui, B., Qu, G., Yang, J., Li, B., et al. (2024b). Can llm already serve as a database interface? a big bench for large-scale database grounded text-to-sqls. NeuriPS, 36.
Wenz, F., Bouattour, O., Yang, D., Choi, J., Gregg, C., Tatbul, N., and Demiralp, Ç. (2026). Benchpress: A human-in-the-loop annotation system for rapid text-to-sql benchmark curation. In CIDR.
Yamate, B. Y., Neubauer, T. R., Fantinato, M., and Peres, S. M. (2025). Text-to-sql oriented to the process mining domain: A pt-en dataset for query translation. arXiv preprint arXiv:2509.09684.
Yu, T., Zhang, R., Yang, K., Yasunaga, M., Wang, D., Li, Z., Ma, J., Li, I., Yao, Q., Roman, S., Zhang, Z., and Radev, D. (2018). Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-SQL task. In EMNLP, pages 3911–3921.
