Limitações da avaliação baseada em testes: quando códigos não atendem à enunciados de questões de programação em juízes on-line

Resumo


Introdução: Juízes on-line são muito utilizados em disciplinas de programação. Esses sistemas funcionam com base em casos de teste, executando o código e indicando se está correto ou não. Assim, não são levados em consideração outros aspectos que podem ser relevantes para a aprendizagem. Um exemplo disso, é que não é possível identificar se o código do estudante seguiu o que é solicitado no enunciado da questão. Objetivo: Este trabalho apresenta um método para detectar casos em que o código não cumpriu os requisitos solicitados. Metodologia: Para tanto, foram utilizadas técnicas de aprendizagem de máquina. Resultados: Os resultados indicam que, entre soluções classificadas como corretas, existem casos em que os requisitos da questão não foram cumpridos, evidenciando limitações na avaliação baseada em testes.
Palavras-chave: Juízes On-line, Educação em Computação, Aprendizagem de Programação

Referências

Aha, D. W., Kibler, D., e Albert, M. K. (1991). Instance-based learning algorithms. Machine learning, 6(1):37–66.

Alves, F. P. e Jaques, P. (2014). Um ambiente virtual com feedback personalizado para apoio a disciplinas de programação. In Anais dos Workshops do Congresso Brasileiro de Informática na Educação, volume 3, page 51.

Barbosa, A. d. A., de Barros Costa, E., e Brito, P. H. (2023). Juízes online são suficientes ou precisamos de um var? In Simpósio Brasileiro de Educação em Computação (EDUCOMP), pages 386–394. SBC.

Burrows, S. e Tahaghoghi, S. M. (2007). Source code authorship attribution using n-grams. In Proceedings of the twelth Australasian document computing symposium, Melbourne, Australia, RMIT University, pages 32–39. Citeseer.

Carvalho, L. S., Oliveira, D. B., e Gadelha, B. F. (2016). Juiz online como ferramenta de apoio a uma metodologia de ensino híbrido em programação. In Simpósio Brasileiro de Informática na Educação (SBIE), pages 140–149. SBC.

de Oliveira, D. B., Lavareda Filho, R. M., Oliveira, E. H., Carvalho, L. S., Pereira, F. D., Colonna, J. G., e Menezes, A. (2021). Um método de detecção de plágio para sistemas juiz on-line baseado no comportamento dos alunos. In Simpósio Brasileiro de Informática na Educação (SBIE), pages 836–848. SBC.

Figueras, C., Farazouli, A., Cerratto Pargman, T., McGrath, C., e Rossitto, C. (2025). Promises and breakages of automated grading systems: a qualitative study in computer science education. Education Inquiry, pages 1–22.

Glassman, E. L., Scott, J., Singh, R., Guo, P. J., e Miller, R. C. (2015). Overcode: Visualizing variation in student solutions to programming problems at scale. ACM Transactions on Computer-Human Interaction (TOCHI), 22(2):1–35.

Ihantola, P., Ahoniemi, T., Karavirta, V., e Seppälä, O. (2010). Review of recent systems for automatic assessment of programming assignments. In Proceedings of the 10th Koli calling international conference on computing education research, pages 86–93.

Keuning, H., Jeuring, J., e Heeren, B. (2018). A systematic literature review of automated feedback generation for programming exercises. ACM Transactions on Computing Education (TOCE), 19(1):1–43.

Liu, K., Han, Y., Zhang, J. M., Chen, Z., Sarro, F., Harman, M., Huang, G., e Ma, Y. (2023). Who judges the judge: An empirical study on online judge tests. In Proceedings of the 32nd acm sigsoft international symposium on software testing and analysis, pages 334–346.

Melo, R., Souza, T., Pires, F., Oliveira, E., Carvalho, L., Pessoa, M., e Fernandes, D. (2026). Exploring the use of clustering algorithms and llms to identify programming strategies. Revista Brasileira de Informática na Educação, 34:59–82.

Nijkamp, E., Hayashi, H., Xiong, C., Savarese, S., e Zhou, Y. (2023). Codegen2: Lessons for training llms on programming and natural languages. arXiv preprint arXiv:2305.02309.

Oliveira, A. M. d. et al. (2016). Um método de detecção de plágio em códigos-fonte para disciplinas iniciais de programação.

Pimentel, E. P., da Silva, L. D. L., Takeuti, R. H., e Braga, J. C. (2025). Abordagem com llm para geração automatizada de feedback no ensino de programação de computadores. In Simpósio Brasileiro de Informática na Educação (SBIE), pages 590–602. SBC.

Raihan, N., Siddiq, M. L., Santos, J. C., e Zampieri, M. (2025). Large language models in computer science education: A systematic literature review. In Proceedings of the 56th ACM Technical Symposium on Computer Science Education V. 1, pages 938–944.

Sparck Jones, K. (1972). A statistical interpretation of term specificity and its application in retrieval. Journal of documentation, 28(1):11–21.

Vinutha, H., Poornima, B., e Sagar, B. (2018). Detection of outliers using interquartile range technique from intrusion dataset. In Information and decision sciences: Proceedings of the 6th international conference on ficta, pages 511–518. Springer.

Wasik, S., Antczak, M., Badura, J., Laskowski, A., e Sternal, T. (2018). A survey on online judge systems and their applications. ACM Computing Surveys (CSUR), 51(1):1–34.

Zhang, J., Li, D., Kolesar, J. C., Shi, H., e Piskac, R. (2022). Automated feedback generation for competition-level code. In Proceedings of the 37th IEEE/ACM international conference on automated software engineering, pages 1–13.
Publicado
05/10/2026
MELO, Rafaela; AGUIAR, Davi; PIRES, Fernanda; GALVÃO, Leandro; FERNANDES, Horácio; PESSOA, Marcela; FERNANDES, David. Limitações da avaliação baseada em testes: quando códigos não atendem à enunciados de questões de programação em juízes on-line. In: SIMPÓSIO BRASILEIRO DE INFORMÁTICA NA EDUCAÇÃO (SBIE), 37. , 2026, Goiânia/GO. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 1444-1457. DOI: https://doi.org/10.5753/sbie.2026.27839.