BAGLEY: Orquestração Automatizada Baseada em LLM de Ciclos de Purple Teaming e MITRE CALDERA

Resumo


Para mitigar os riscos da rápida evolução das ameaças cibernéticas, são necessárias estratégias de defesa dinâmicas que superem a eficácia de modelos rígidos e testes esporádicos. Este artigo apresenta o BAGLEY, uma plataforma de orquestração integrada que automatiza o ciclo de Purple Teaming ao vincular a emulação ofensiva do MITRE CALDERA com a análise defensiva do Wazuh SIEM. Orquestrado por um Large Language Model (LLM), o sistema abstrai a complexidade técnica traduzindo intenções táticas de alto nível em comandos multiplataforma executáveis. O BAGLEY apresenta um Loop Cognitivo exclusivo que realiza a correspondência automatizada de telemetria, identifica lacunas de detecção e corrige falhas de execução em tempo real por meio de um mecanismo de resiliência autônoma. Resultados experimentais em ambientes multiplataforma demonstram a capacidade do sistema de executar ataques furtivos do tipo Living off the Land (LOTL); filtrar o ruído do sistema para isolar indicadores de alta relevância; e formular relatórios forenses acionáveis com recomendações de mitigação prontas para implantação.

Referências

Nguyen, T. T. et al. (2021). Deep reinforcement learning for cyber security. IEEE Transactions on Neural Networks and Learning Systems.

Jaffal, N. O., Alkhanafseh, M., and Mohaisen, D. (2025). Large Language Models in cybersecurity: A survey of applications, vulnerabilities, and defense techniques. AI, 6(9):216.

Singer, J. et al. (2025). On the feasibility of using LLMs to autonomously execute multi-host network attacks. arXiv preprint 2501.16466.

Liu, Y. et al. (2018). AURORA: Automated Adversary Emulation via PDDL and Large Language Models. In Proc. 24th ACM SIGKDD.

Hammar, K. et al. (2025). Incident Response Planning Using a Lightweight Large Language Model with Reduced Hallucination. arXiv preprint arXiv:2508.05188.

Tellache, A. et al. (2025). Advancing Autonomous Incident Response: Leveraging LLMs and Cyber Threat Intelligence. arXiv preprint arXiv:2508.10677.

Hardikar, S. et al. (2025). CyberSleuth: A Multi-Agent Architecture for Autonomous Forensic Analysis. In Proc. Int. Conf. on Information Security and Cryptology (ICISC).

Huang, L. et al. (2022). SAGA: Synthetic Audit Log Generation for APT Campaigns. In Proc. ACM SIGSAC CCS.

Sandaruwan, M. T., Wijayanayake, J., and Senanayake, J. (2025). Integrating Large Language Models for automated vulnerability scanning and reporting in network hosts. In IEEE SCSE.

MITRE (2025). CALDERA Documentation. Online. Available: [link]

Miller, D. et al. (2018). Automated Adversary Emulation: A Case for Planning and Acting with Unknowns.

Yin, Z. et al. (2025). Digital Forensics in the Age of Large Language Models. arXiv preprint 2504.02963.

Wang, L. et al. (2024). From Sands to Mansions: Towards Automated Cyberattack Emulation with Classical Planning and Large Language Models. arXiv preprint 2407.16928.

Carlini, N. et al. (2026). Assessing Claude Mythos Preview’s cybersecurity capabilities. Anthropic. Online. Disponível em: [link].
Publicado
01/09/2026
MACHADO, Junior Petry; PONTES, Alexandre Alyson Sousa; FONTES, Ramon dos Reis. BAGLEY: Orquestração Automatizada Baseada em LLM de Ciclos de Purple Teaming e MITRE CALDERA. In: SIMPÓSIO BRASILEIRO DE CIBERSEGURANÇA (SBSEG), 26. , 2026, Armação dos Búzios/RJ. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 254-268. DOI: https://doi.org/10.5753/sbseg.2026.27023.