Simulação de Proficiência Discente do ENEM via Grandes Modelos de Linguagem: Uma Análise da Aderência à TRI

  • Caio César Farias da Silva Universidade Federal Rural de Pernambuco (UFRPE)
  • Roberta Macedo Marques Gouveia Universidade Federal Rural de Pernambuco (UFRPE)
  • Maria da Conceição Moraes Batista Universidade Federal Rural de Pernambuco (UFRPE)
  • Gabriel Alves Universidade Federal Rural de Pernambuco (UFRPE) https://orcid.org/0000-0002-2249-7818

Resumo


A calibração de itens na Teoria da Resposta ao Item é um processo operacionalmente complexo e oneroso, exigindo uma quantidade significativa de respondentes. Este trabalho propõe o uso de Grandes Modelos de Linguagem para a simulação de respostas a questões do ENEM, combinando engenharia de prompt e formatos de serialização de dados, avaliando a aderência psicométrica e o custo computacional. Os resultados indicam a viabilidade da abordagem, com a preservação da ordenação de dificuldade dos itens. O formato TOON reduziu o consumo de tokens em aproximadamente 25% sem perda expressiva de qualidade. A análise demonstrou que ganhos de fidelidade psicométrica e eficiência operacional podem ser obtidos de forma mútua.
Palavras-chave: Grandes Modelos de Linguagem, Teoria da Resposta ao Item, Simulação de Respondentes

Referências

Acquaye, C. et al. (2026). Take out your calculators: Estimating the real difficulty of question items with llm student simulations. arXiv preprint arXiv:2601.09953.

AlKhuzaey, S., Grasso, F., Payne, T. R., and Tamma, V. (2024). Text-based question difficulty prediction: A systematic review of automatic approaches. International Journal of Artificial Intelligence in Education, 34(3):862–914.

Andrade, D. F. d., Tavares, H. R., and Valle, R. d. C. (2000). Teoria da Resposta ao Item: Conceitos e Aplicações. Associação Brasileira de Estatística, São Paulo.

Benedetto, L., Aradelli, G., Donvito, A., Lucchetti, A., Cappelli, A., and Buttery, P. (2024). Using llms to simulate students' responses to exam questions. In Findings of the Association for Computational Linguistics: EMNLP 2024, pages 11351–11368, Miami, Florida, USA. Association for Computational Linguistics.

Liu, Y., Bhandari, S., and Pardos, Z. A. (2025). Leveraging llm respondents for item evaluation: A psychometric analysis. British Journal of Educational Technology, 56(3):1028–1052.

Lu, X. and Wang, X. (2024). Generative students: Using llm-simulated student profiles to support question item evaluation. In Proceedings of the Eleventh ACM Conference on Learning @ Scale, L@S '24, pages 16–27, New York, NY, USA. Association for Computing Machinery.

Pasquali, L. (2003). Os itens de um teste. In Psicometria: teoria dos testes na psicologia e na educação, pages 137–160. Vozes, Petrópolis.

Sobrinho, A. and Cavalcanti, C. R. (2023). Políticas educacionais de avaliação em larga escala no brasil: o enem em foco. Revista Contemporânea de Educação, 18(41):226–246.

Song, Y., Li, H., and Zheng, Q. (2026). Multi-agent automated item generation based on large language models. Journal of Educational Technology & Society, 29(2):233–248.

Souza, J. A. d., Rodrigues, E., Gouveia, R., and Alves, G. (2025). Uma abordagem baseada em simulação com grandes modelos de linguagem para validação de dificuldade de questões do enem a partir da tri. In Anais do Workshop de Aplicações Práticas de Learning Analytics e Inteligência Artificial no Brasil (WAPLA), pages 91–99, Porto Alegre. Sociedade Brasileira de Computação.

TOON (2026). Benchmarks. Online. Disponível em: [link]. Acesso em: 24 abr. 2026.

Travitzki, R. (2013). Enem: limites e possibilidades do exame nacional do ensino médio após a adoção da tri. Estudos em Avaliação Educacional, 28(67):44–76.

Şahin, A. and Anıl, D. (2017). The effects of test length and sample size on item parameters in item response theory. Educational Sciences: Theory & Practice, 17(1):321–335.
Publicado
05/10/2026
DA SILVA, Caio César Farias; GOUVEIA, Roberta Macedo Marques; BATISTA, Maria da Conceição Moraes; ALVES, Gabriel. Simulação de Proficiência Discente do ENEM via Grandes Modelos de Linguagem: Uma Análise da Aderência à TRI. In: SIMPÓSIO BRASILEIRO DE INFORMÁTICA NA EDUCAÇÃO (SBIE), 37. , 2026, Goiânia/GO. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 2766-2775. DOI: https://doi.org/10.5753/sbie.2026.28068.