Text-to-SQL na Era dos Grandes Modelos de Linguagem: Fundamentos, Avaliação e o Cenário Brasileiro
Resumo
A tarefa Text-to-SQL tem avançado significativamente com o uso de Grandes Modelos de Linguagem (LLMs). Apesar desse progresso, avaliações conduzidas em benchmarks tradicionais como Spider e BIRD podem superestimar a capacidade real dos modelos, conforme evidenciado por trabalhos recentes em cenários empresariais e em língua portuguesa. Este tutorial avançado apresenta, de forma sistemática, os fundamentos e o estado da arte da tarefa, cobrindo: (i) as principais abordagens baseadas em LLMs e sistemas agênticos; (ii) uma taxonomia crítica de métricas de avaliação; (iii) metodologias de construção de benchmarks; e (iv) o panorama da tarefa em português, com ênfase no contexto brasileiro.
Referências
Camara, E., Zardin, J., et al. (2026). Pairs: Um pipeline para geração automática e curadoria de benchmarks text-to-sql. In SBBD.
Chen, P. B., Yang, D., Li, W., Wenz, F., Zhang, Y., Tatbul, N., Cafarella, M., Demiralp, Ç., and Stonebraker, M. (2024). Beaver: an enterprise benchmark for text-to-sql. arXiv preprint arXiv:2409.02038.
de Carvalho Fróes, K. and Braghetto, K. R. (2025). Exploring temporal text-to-sql challenges in brazilian portuguese: Lessons from educational data. In SBBD, pages 963–969.
Fonseca, G. et al. (2026). Avaliação sistemática de text-to-sql em português: Um benchmark unificado multi-domínio. In SBBD.
Gao, D. et al. (2024). Text-to-sql empowered by large language models: A benchmark evaluation. VLDB Endowment, 17(5):1132–1145.
Jose, M. A. and Cozman, F. G. (2023). A multilingual translator to sql with database schema pruning to improve self-attention. Int’l Journal of Information Technology, 15(6):3015–3023.
Katsogiannis-Meimarakis, G. and Koutrika, G. (2023). A survey on deep learning approaches for text-to-sql. The VLDB Journal, 32(4):905–936.
Lei, F. et al. (2025). Spider 2.0: Evaluating language models on real-world enterprise text-to-sql workflows. In ICLR, pages 28691–28735.
Li, H. et al. (2024). Codes: Towards building open-source language models for text-to-sql. PACMMOD.
Li, J. et al. (2023). Can llm already serve as a database interface? a big bench for large-scale database grounded text-to-sqls. NeurIPS, 36:42330–42357.
Moraes, M. et al. (2025). From questions to answers: A natural language interface for datasus hospitalization data. In ERAMIA-RS, pages 296–299.
Pedroso, B. C., Pereira, M. R., and Pereira, D. A. (2025). Performance evaluation of llms in the text-to-sql task in portuguese. In SBSI, pages 260–269.
Shi, L. et al. (2025). A survey on employing large language models for text-to-sql tasks. ACM Computing Surveys, 58(2):1–37.
Wang, B. et al. (2025). Mac-sql: A multi-agent collaborative framework for text-to-sql. In COLING.
Wenz, F. et al. (2025). Benchpress: A human-in-the-loop annotation system for rapid text-to-sql benchmark curation. arXiv preprint arXiv:2510.13853.
Yamate, B. Y., Neubauer, T. R., Fantinato, M., and Peres, S. M. (2025). Text-to-sql oriented to the process mining domain: A pt-en dataset for query translation. arXiv preprint arXiv:2509.09684.
Yu, T. et al. (2018). Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task. In EMNLP, pages 3911–3921.
Zhong, V., Xiong, C., and Socher, R. (2017). Seq2sql: Generating structured queries from natural language using reinforcement learning. arXiv preprint arXiv:1709.00103.
