A Modular IPA Framework for Semantic Retrieval and Generation in Legal-Administrative Workflows

  • Arthur C. e Silva Universidade de Fortaleza (UNIFOR) https://orcid.org/0009-0005-7809-4224
  • Robson Costa Universidade Federal do Ceará (UFC)
  • Daniel Coutinho Universidade Federal do Ceará (UFC)
  • Luis Oliveira Universidade Federal do Ceará (UFC)
  • Paulo Parente Universidade Federal do Ceará (UFC)
  • Carlos Caminha Universidade Federal do Ceará (UFC) / Universidade de Fortaleza (UNIFOR)

Resumo


The growth of document collections has made manual analysis inefficient in contexts that require synthesis and traceability. This work proposes a framework for orchestrating pipelines in the context of Intelligent Process Automation (IPA), focused on processing unstructured data. The solution integrates OCR, NLP, machine learning, and LLMs within a modular and general-purpose architecture, with support for open-source models. A case study involving more than 14,000 legal-administrative documents demonstrated that the approach enables extraction, semantic enrichment, and vector search. The results indicate gains in efficiency, organization, and support for automated document generation.
Palavras-chave: Machine Learning, AI and Databases, Text and IR

Referências

Almeida, F. C. and Caminha, C. (2024). Evaluation of entry-level open-source large language models for information extraction from digitized documents. In Symposium on Knowledge Discovery, Mining and Learning (KDMiLe), pages 25–32. SBC.

Berger, P. P., Souza, M. W., Quartezani, H., Merisio, G., Fazolo, I. A., Andrade, L. G. F., and Silva, S. T. (2024). Automação da classificação de documentos do ministério público de acordo com os objetivos de desenvolvimento sustentável utilizando processamento de linguagem natural. In Anais Estendidos do XXXIX Simpósio Brasileiro de Bancos de Dados (SBBD), pages 302–307, Florianópolis, SC, Brazil. SBC.

dos S. Bezerra, A. L., Batalha, I. S., Filho, L. R. A., Almeida, C. M., Dantas, M. I. N., and Gouêa, N. A. (2025). RPAs e Data Lakes para a Indústria 4.0: Um Estudo de Caso de Ecossistema de Dados Integrados. In Anais do XL Simpósio Brasileiro de Bancos de Dados (SBBD), pages 753–759, Fortaleza, CE, Brazil. SBC.

Juell-Skielse, G., Lindgren, I., and Åkesson, M. (2022). Service automation in the public sector. In Progress in Information Systems, pages 101–120. Springer.

Langmann, C. and Turi, D. (2022). Robotic Process Automation (RPA): Digitization and Automation in Public and Private Sectors. Springer, Wiesbaden, Germany.

Ngai, E. W. T., Lui, A. K. H., and Kei, B. C. W. (2025). Natural language processing in government applications: A literature review and a case analysis. Industrial Management & Data Systems, 125(6):2067–2104.

Raviolo, B., Chaves, J. L. M. S., Filho, R. H., and Caminha, C. (2025). Tricia: A multiagent system to simplify interaction with the business intelligence dashboard platform of the fiscal monitor. In Companion Proceedings of the 40th Brazilian Symposium on Databases (SBBD), Fortaleza, CE, Brazil. SBC.
Publicado
08/09/2026
C. E SILVA, Arthur; COSTA, Robson; COUTINHO, Daniel; OLIVEIRA, Luis; PARENTE, Paulo; CAMINHA, Carlos. A Modular IPA Framework for Semantic Retrieval and Generation in Legal-Administrative Workflows. In: DEMONSTRAÇÕES E APLICAÇÕES - SIMPÓSIO BRASILEIRO DE BANCO DE DADOS (SBBD), 41. , 2026, São Carlos/SP. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 287-292. DOI: https://doi.org/10.5753/sbbd_estendido.2026.249620.