Extração de Dados Não Estruturados de Promoções de Arquivamento de Inquéritos via Arquiteturas Multiagentes e LLMs
Resumo
Este estudo tem como objetivo principal a estruturação de dados textuais de inquéritos policiais do MPSP por meio de LLMs e arquiteturas multiagentes. Para tanto, avaliaram-se diferentes modelos e graus de modularização de prompts, verificando seu impacto na precisão e no consumo de recursos. Os resultados indicam que modelos mais robustos asseguram maior precisão, ao passo que a alta modularização facilita a adesão ao esquema de saída desejado. Por outro lado, tal fragmentação resulta em maior consumo de tokens e reduz a eficácia em textos menos extensos, limitando a viabilidade financeira da solução em larga escala.
Referências
Batitucci, L. A., Lopes, L. I., Ferreira, R., and Paraiso, E. C. (2026). Agent orchestration - LLM for legal metadata extraction: A comparative analysis of efficiency and precision. In Souza, M., de Dios-Flores, I., Santos, D., Freitas, L., Souza, J. W. d. C., and Ribeiro, E., editors, Proceedings of the 17th International Conference on Computational Processing of Portuguese (PROPOR 2026) - Vol. 1, pages 727–737, Salvador, Brazil. Association for Computational Linguistics.
Cerqueira, D. and Bueno, S. (2024). Atlas da Violência 2024. Ipea and FBSP, Brasília. Acesso em: 25 fev. 2025.
Garcia, E. A. S. (2024). Open portuguese llm leaderboard. Acesso em: nov. 2025.
Instituto Sou da Paz (2024). Onde mora a impunidade?
Luz de Araujo, P. H., de Campos, T. E., de Oliveira, R. R. R., Stauffer, M., Couto, S., and Bermejo, P. (2018). LeNER-Br: a dataset for named entity recognition in Brazilian legal text. In International Conference on the Computational Processing of Portuguese (PROPOR), Lecture Notes on Computer Science (LNCS), pages 313–323, Canela, RS, Brazil. Springer.
Minaee, S., Mikolov, T., Nikzad, N., Chenaghlu, M., Socher, R., Amatriain, X., and Gao, J. (2024). Large language models: A survey. arXiv preprint arXiv:2311.00010.
White, J., Fu, Q., Hays, S., Vierhauser, M., Neill, R., Wiburne, E., Dorn, B., and Schmidt, D. C. (2023). A prompt pattern catalog to enhance prompt engineering with chatgpt.
Wu, J., Han, J., and Gao, Y. (2025). Tabagent: A multi-agent table extraction framework for unstructured documents. In 2025 5th International Symposium on Artificial Intelligence and Big Data (AIBDF), pages 600–607.
Zhong, H., Xiao, C., Tu, C., Zhang, T., Liu, Z., and Sun, M. (2020). How does nlp benefit the legal system: A summary of legal artificial intelligence. CoRR, abs/2004.12158.
