Geração de Questões no Padrão ENADE com LLMs: Um Estudo sobre Conteúdo Didático de Apoio, Validação Automática e Avaliação Humana

  • Heder Silva Santos Universidade Federal Rural de Pernambuco (UFRPE)
  • Anderson Pinheiro Cavalcanti Universidade Federal Rural de Pernambuco (UFRPE)
  • João Pedro Freire Instituto Federal do Rio Grande do Norte (IFRN)
  • Francisco Braulio Silva de Oliveira Universidade Presbiteriana Mackenzie (UPM)
  • Wiully Costa Instituto Federal do Rio Grande do Norte (IFRN)
  • Mario Antonio Pessoa Santos Instituto Federal do Rio Grande do Norte (IFRN)
  • Tyagi Lima Instituto Federal do Rio Grande do Norte (IFRN)
  • Armando M. Toda Universidade Tecnológica Federal do Paraná (UTFPR)
  • Luiz Rodrigues Universidade Tecnológica Federal do Paraná (UTFPR)
  • Rafael Ferreira Mello Universidade Federal Rural de Pernambuco (UFRPE) https://orcid.org/0000-0003-3548-9670

Resumo


A geração automática de questões é uma tarefa complexa, especialmente em contextos formais como o ENADE, nos quais as questões devem apresentar texto-base contextualizado, enunciado claro, alternativas plausíveis, alinhamento pedagógico e adequação ao nível cognitivo esperado. Nesse cenário, grandes modelos de linguagem têm sido explorados como ferramentas promissoras para apoiar a geração automática de questões. No entanto, ainda há desafios relacionados à qualidade pedagógica dos itens gerados, ao uso efetivo de materiais didáticos como contexto e à confiabilidade de agentes automáticos na validação desses materiais. Este trabalho teve como objetivo avaliar a geração automática de questões no padrão ENADE por meio de LLMs, investigando o impacto do uso de conteúdo didático no prompt e a capacidade de um agente automático de qualidade em identificar itens adequados antes da revisão humana. Para isso, foi conduzido um experimento com delineamento fatorial 2x2, considerando questões geradas com e sem conteúdo de apoio, bem como aprovadas ou rejeitadas por um agente de validação. Ao todo, foram geradas e avaliadas 256 questões, distribuídas entre oito disciplinas de diferentes áreas do conhecimento e analisadas por revisores humanos especialistas. Os resultados indicaram uma taxa geral de aprovação humana de 9,0%, sendo o melhor desempenho observado nas questões geradas com conteúdo e aprovadas pelo agente, com 15,6% de aprovação. A análise por critérios revelou melhor desempenho em aspectos estruturais, como alternativas e ausência de erros conceituais, e maiores dificuldades em texto-base, taxonomia, dificuldade e resolução comentada.
Palavras-chave: Geração Automática de Questões, Grandes Modelos de Linguagem, ENADE

Referências

Ali, H., Chali, Y., and Hasan, S. A. (2010). Automatic question generation from sentences. In Actes de la 17e conférence sur le Traitement Automatique des Langues Naturelles. Articles courts, pages 213–218.

Ashok Kumar, N. and Lan, A. (2024). Improving socratic question generation using data augmentation and preference optimization. In Kochmar, E., Bexte, M., Burstein, J., Horbach, A., Laarmann-Quante, R., Tack, A., Yaneva, V., and Yuan, Z., editors, Proceedings of the 19th Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2024), pages 108–118, Mexico City, Mexico. Association for Computational Linguistics.

Awalurahman, H. W., Aji, R. F., and Budi, I. (2025). Transformer and large language models for automatic multiple-choice question generation: A systematic literature review. IEEE Access, 13:127100–127119.

Bloom, B. S., Hastings, J. T., and Madaus, G. F. (1971). Handbook on Formative and Summative Evaluation of Student Learning. McGraw-Hill, New York.

Brasil. INEP (2025). Guia de Elaboração e Revisão de Itens: BNI — Enade. Instituto Nacional de Estudos e Pesquisas Educacionais Anísio Teixeira, Brasília.

Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., Agarwal, S., Herbert-Voss, A., Krueger, G., Henighan, T., Child, R., Ramesh, A., Ziegler, D. M., Wu, J., Winter, C., Hesse, C., Chen, M., Sigler, E., Litwin, M., Gray, S., Chess, B., Clark, J., Berner, C., McCandlish, S., Radford, A., Sutskever, I., and Amodei, D. (2020). Language models are few-shot learners. In Advances in Neural Information Processing Systems, volume 33, pages 1877–1901.

Carbonell, J. R. (1970). Ai in cai: An artificial-intelligence approach to computer-assisted instruction. In IEEE Transactions on Man-Machine Systems, volume 11, pages 190–202.

Ch, D. R. and Saha, S. K. (2020). Automatic multiple choice question generation from text: A survey. IEEE Transactions on Learning Technologies, 13(1):14–25.

Cheng, C., Huang, Z., Zhao, G., Guo, Y., Lin, X., Wu, J., Li, X., and Wang, S. (2025). From objectives to questions: A planning-based framework for educational mathematical question generation. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 12836–12856. Association for Computational Linguistics.

Fernandes, N. d. M., Batista, M. d. C. M., Gouveia, R. M. M., Mello, R. F., and Alves, G. (2025). Suporte à elaboração de matriz curricular e disciplinas com inteligência artificial generativa e grafos para cursos de graduação. In Anais do XXXVI Simpósio Brasileiro de Informática na Educação (SBIE 2025), pages 496–509. SBC.

Ghanem, B. and Fyshe, A. (2023). Disto: Evaluating textual distractors for multi-choice questions using negative sampling based approach.

Heilman, M. and Smith, N. A. (2010). Good question! statistical ranking for question generation. In Human language technologies: The 2010 annual conference of the North American Chapter of the Association for Computational Linguistics, pages 609–617.

Huang, L., Yu, W., Ma, W., Zhong, W., Feng, Z., Wang, H., Chen, Q., Peng, W., Feng, X., Qin, B., and Liu, T. (2025). A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions. ACM Transactions on Information Systems, 43(2):1–55.

Kasneci, E., Sessler, K., Küchemann, S., Bannert, M., Dementieva, D., Fischer, F., Gasser, U., Groh, G., Günnemann, S., Hüllermeier, E., Krusche, S., Kutyniok, G., Michaeli, T., Nerdel, C., Pfeffer, J., Poquet, O., Sailer, M., Schmidt, A., Seidel, T., Stadler, M., Weller, J., Kuhn, J., and Kasneci, G. (2023). Chatgpt for good? on opportunities and challenges of large language models for education. Learning and Individual Differences, 103:102274.

Kurdi, G., Leo, J., Parsia, B., et al. (2020). A systematic review of automatic question generation for educational purposes. International Journal of Artificial Intelligence in Education, 30(1):121–204.

Leite, B. and Lopes Cardoso, H. (2025a). Advancing question generation with joint narrative and difficulty control. In Proceedings of the 20th Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2025), pages 647–659. Association for Computational Linguistics.

Leite, B. and Lopes Cardoso, H. (2025b). Advancing question generation with joint narrative and difficulty control. In Proceedings of the 20th Workshop on Innovative Use of NLP for Building Educational Applications, pages 647–659, Vienna, Austria. Association for Computational Linguistics.

Liang, C., Yang, X., Dave, N., Wham, D., Pursel, B., and Giles, C. L. (2018). Distractor generation for multiple choice questions using learning to rank. In Tetreault, J., Burstein, J., Kochmar, E., Leacock, C., and Yannakoudakis, H., editors, Proceedings of the Thirteenth Workshop on Innovative Use of NLP for Building Educational Applications, pages 284–290, New Orleans, Louisiana. Association for Computational Linguistics.

Ma, W. A., Flor, M., and Wang, Z. (2025). Automatic generation of inference making questions for reading comprehension assessments. In Proceedings of the 20th Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2025), pages 398–414, Vienna, Austria. Association for Computational Linguistics.

Mello, R. F., Rodrigues, L., Cabral, L., Pereira, F. D., Pereira Júnior, C., Gasevic, D., and Ramalho, G. (2024). Prompt engineering for automatic short answer grading in brazilian portuguese. In Anais do XXXV Simpósio Brasileiro de Informática na Educação (SBIE 2024), pages 1730–1743. SBC.

Mendes, A., Parizotto, A., Garcia, R., Garcia, M., Guedes, G., Vilela, R., Valle, P., Balancieri, R., and Silva, W. (2025). Coderbot 2.0: Integrating llm and prompt engineering in the evolution of an educational chatbot. In Anais do XXXVI Simpósio Brasileiro de Informática na Educação (SBIE 2025), pages 1498–1507. SBC.

Mulla, N. and Gharpure, P. (2023). Automatic question generation: a review of methodologies, datasets, evaluation metrics, and applications. 12(1):1–32.

Nicolini, A. M. and Andrade, R. O. B. (2015). Padrão Enade: Análise, Reflexões e Proposições à Luz da Taxonomia de Bloom. Grupo GEN, São Paulo.

Nogueira, J. V. d. C. M. F., Castro, J. A. P. d., Larcher, L. O., Ferreira, R. V. J., Barbosa, B. T., and Souza, J. F. d. (2025). Uma análise de qualidade do uso de grandes modelos de linguagem para geração automática de itens avaliativos em português. In Anais do XXXVI Simpósio Brasileiro de Informática na Educação (SBIE 2025), pages 235–248. SBC.

Pasquali, L. et al. (2003). Fundamentos da teoria da resposta ao item – tri. Avaliação Psicológica, 2(2):99–110.

Pirovani, J., Spalenza, M., and Oliveira, E. (2017). Geração automática de questões a partir do reconhecimento de entidades nomeadas em textos didáticos. page 1147.

Quincozes, C. B., Molinos, D., Araújo, R. D., Quincozes, S., and Guedes, G. T. A. (2025). Engenharia de prompt para a geração automatizada de questões assistida por llms: Uma análise comparativa. In Anais do XXXVI Simpósio Brasileiro de Informática na Educação (SBIE 2025), pages 1347–1360. SBC.

Rabelo, M. (2013). Avaliação educacional: fundamentos, metodologia e aplicações no contexto brasileiro. SBM, Rio de Janeiro.

Rodrigues Neto, J., Alves, G., and Mello, R. F. (2025). Llmagentgrader: Sistema multiagente com deepseek para correção automática aprimorada de respostas curtas. In Anais do XXXVI Simpósio Brasileiro de Informática na Educação (SBIE 2025), pages 617–628. SBC.

Santos, M., Barros, A., Santos, E., Silva, J., Isotani, S., Bittencourt, I., Macario, V., Rodrigues, L., and Dermeval, D. (2025). Geração de questões com llms leves: Um estudo inicial sobre a percepção de educadores. In Anais do XXXVI Simpósio Brasileiro de Informática na Educação, pages 1636–1647, Porto Alegre, RS, Brasil. SBC.

Scarlatos, A., Feng, W., Smith, D., Woodhead, S., and Lan, A. (2024). Improving automated distractor generation for math multiple-choice questions with overgenerate-and-rank. In Kochmar, E., Bexte, M., Burstein, J., Horbach, A., Laarmann-Quante, R., Tack, A., Yaneva, V., and Yuan, Z., editors, Proceedings of the 19th Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2024), pages 222–231, Mexico City, Mexico. Association for Computational Linguistics.

Silva, E. P. d. and Reis, J. C. d. (2025). Designing an llm-based multiagent system for generating activities and their rubrics: A study on data mining. In Anais do XXXVI Simpósio Brasileiro de Informática na Educação (SBIE 2025), pages 959–973. SBC.

Silva, F. G. and da Silva Aranha, E. H. (2025). Feedback formativo automatizado com llms: Desenvolvimento e análise de um sistema para aprendizagem progressiva em programação. In Simpósio Brasileiro de Informática na Educação (SBIE), pages 1158–1172. SBC.

Silva, R. Z. d., Pinho, P. C. R., Moreira, M. I. G., Ferreira Filho, R. C. M., and Primo, T. T. (2024). Integração de ia generativa e repositórios educacionais: Potencializando a eficácia pedagógica e a recomendação de conteúdos com o llama2. In Anais do XXXV Simpósio Brasileiro de Informática na Educação (SBIE 2024), pages 3029–3037. SBC.

Toba, H., Yudha, L. G. O. P., Karnalim, O., Bunyamin, H., and Tada, T. (2025). A large language model question generator based on bloom's taxonomy template. In Proceeding of the 2024 8th International Conference on Education and E-Learning, ICEEL '24, page 25–31, New York, NY, USA. Association for Computing Machinery.

Tomikawa, Y. and Uto, M. (2024). Difficulty-controllable multiple-choice question generation for reading comprehension using item response theory. In Artificial Intelligence in Education. Posters and Late Breaking Results, Workshops and Tutorials, Industry and Innovation Tracks, Practitioners, Doctoral Consortium and Blue Sky, pages 312–320, Cham. Springer Nature Switzerland.

Uto, M., Tomikawa, Y., and Suzuki, A. (2023). Difficulty-controllable neural question generation for reading comprehension using item response theory. In Proceedings of the 18th Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2023), pages 119–129, Toronto, Canada. Association for Computational Linguistics.

Wang, L., Song, R., Guo, W., and Yang, H. (2025). Exploring prompt pattern for generative artificial intelligence in automatic question generation. Interactive Learning Environments, 33(3):2559–2584.

Wohlin, C., Runeson, P., Höst, M., Ohlsson, M. C., Regnell, B., Wesslén, A., et al. (2012). Experimentation in software engineering, volume 236. Springer.

Zhang, R., Guo, J., Chen, L., Fan, Y., and Cheng, X. (2021). A review on question generation from natural language text. ACM Transactions on Information Systems, 40(1):1–43.

Zhao, W. X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y., Min, Y., Zhang, B., Zhang, J., Dong, Z., Du, Y., Yang, C., Chen, Y., Chen, Z., Jiang, J., Ren, R., Li, Y., Tang, X., Liu, Z., Liu, P., Nie, J.-Y., and Wen, J.-R. (2023). A survey of large language models. arXiv preprint arXiv:2303.18223.
Publicado
05/10/2026
SANTOS, Heder Silva et al. Geração de Questões no Padrão ENADE com LLMs: Um Estudo sobre Conteúdo Didático de Apoio, Validação Automática e Avaliação Humana. In: SIMPÓSIO BRASILEIRO DE INFORMÁTICA NA EDUCAÇÃO (SBIE), 37. , 2026, Goiânia/GO. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 401-417. DOI: https://doi.org/10.5753/sbie.2026.27158.