Text-to-SQL na Era dos Grandes Modelos de Linguagem: Fundamentos, Avaliação e o Cenário Brasileiro

  • Guilherme Fonseca Universidade Federal de Minas Gerais (UFMG)
  • Julio C. S. Reis Universidade Federal de Viçosa (UFV) https://orcid.org/0000-0003-0563-0434
  • Matheus Botelho Universidade Federal de Minas Gerais (UFMG)
  • Eduardo Camara Universidade Federal do Amazonas (UFAM)
  • Jaide Zardin Universidade Federal do Amazonas (UFAM)
  • Lucas R. Silva Universidade Federal de Minas Gerais (UFMG)
  • Emerson A. Simoes Universidade Federal de Minas Gerais (UFMG)
  • Pedro Calais Universidade Federal de Minas Gerais (UFMG)
  • Rodrigo Gonçalves Universidade Federal de Minas Gerais (UFMG)
  • Gustavo Ribeiro Universidade Federal de Minas Gerais (UFMG)
  • Yago Lobato Universidade Federal do Amazonas (UFAM)
  • Allan Sene Dadosfera Brasil
  • Altigran da Silva Universidade Federal do Amazonas (UFAM) https://orcid.org/0000-0002-8992-495X
  • Marcos André Gonçalves Universidade Federal de Minas Gerais (UFMG)

Resumo


A tarefa Text-to-SQL tem avançado significativamente com o uso de Grandes Modelos de Linguagem (LLMs). Apesar desse progresso, avaliações conduzidas em benchmarks tradicionais como Spider e BIRD podem superestimar a capacidade real dos modelos, conforme evidenciado por trabalhos recentes em cenários empresariais e em língua portuguesa. Este tutorial avançado apresenta, de forma sistemática, os fundamentos e o estado da arte da tarefa, cobrindo: (i) as principais abordagens baseadas em LLMs e sistemas agênticos; (ii) uma taxonomia crítica de métricas de avaliação; (iii) metodologias de construção de benchmarks; e (iv) o panorama da tarefa em português, com ênfase no contexto brasileiro.

Palavras-chave: Text-to-SQL, LLMs, métricas de avaliação, benchmarks

Referências

Botelho, M. et al. (2026). Jabuti-sql: Um benchmark em português para avaliação de abordagens text-to-sql em cenários reais. In DSW/SBBD.

Camara, E., Zardin, J., et al. (2026). Pairs: Um pipeline para geração automática e curadoria de benchmarks text-to-sql. In SBBD.

Chen, P. B., Yang, D., Li, W., Wenz, F., Zhang, Y., Tatbul, N., Cafarella, M., Demiralp, Ç., and Stonebraker, M. (2024). Beaver: an enterprise benchmark for text-to-sql. arXiv preprint arXiv:2409.02038.

de Carvalho Fróes, K. and Braghetto, K. R. (2025). Exploring temporal text-to-sql challenges in brazilian portuguese: Lessons from educational data. In SBBD, pages 963–969.

Fonseca, G. et al. (2026). Avaliação sistemática de text-to-sql em português: Um benchmark unificado multi-domínio. In SBBD.

Gao, D. et al. (2024). Text-to-sql empowered by large language models: A benchmark evaluation. VLDB Endowment, 17(5):1132–1145.

Jose, M. A. and Cozman, F. G. (2023). A multilingual translator to sql with database schema pruning to improve self-attention. Int’l Journal of Information Technology, 15(6):3015–3023.

Katsogiannis-Meimarakis, G. and Koutrika, G. (2023). A survey on deep learning approaches for text-to-sql. The VLDB Journal, 32(4):905–936.

Lei, F. et al. (2025). Spider 2.0: Evaluating language models on real-world enterprise text-to-sql workflows. In ICLR, pages 28691–28735.

Li, H. et al. (2024). Codes: Towards building open-source language models for text-to-sql. PACMMOD.

Li, J. et al. (2023). Can llm already serve as a database interface? a big bench for large-scale database grounded text-to-sqls. NeurIPS, 36:42330–42357.

Moraes, M. et al. (2025). From questions to answers: A natural language interface for datasus hospitalization data. In ERAMIA-RS, pages 296–299.

Pedroso, B. C., Pereira, M. R., and Pereira, D. A. (2025). Performance evaluation of llms in the text-to-sql task in portuguese. In SBSI, pages 260–269.

Shi, L. et al. (2025). A survey on employing large language models for text-to-sql tasks. ACM Computing Surveys, 58(2):1–37.

Wang, B. et al. (2025). Mac-sql: A multi-agent collaborative framework for text-to-sql. In COLING.

Wenz, F. et al. (2025). Benchpress: A human-in-the-loop annotation system for rapid text-to-sql benchmark curation. arXiv preprint arXiv:2510.13853.

Yamate, B. Y., Neubauer, T. R., Fantinato, M., and Peres, S. M. (2025). Text-to-sql oriented to the process mining domain: A pt-en dataset for query translation. arXiv preprint arXiv:2509.09684.

Yu, T. et al. (2018). Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task. In EMNLP, pages 3911–3921.

Zhong, V., Xiong, C., and Socher, R. (2017). Seq2sql: Generating structured queries from natural language using reinforcement learning. arXiv preprint arXiv:1709.00103.
Publicado
08/09/2026
FONSECA, Guilherme et al. Text-to-SQL na Era dos Grandes Modelos de Linguagem: Fundamentos, Avaliação e o Cenário Brasileiro. In: TUTORIAIS - SIMPÓSIO BRASILEIRO DE BANCO DE DADOS (SBBD), 41. , 2026, São Carlos/SP. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 350-354. DOI: https://doi.org/10.5753/sbbd_estendido.2026.44156.