Uma Abordagem para a Otimização do Aprendizado de Agentes Durante o Sequenciamento de Ataques Cibernéticos em Cenários Desconhecidos e Dinâmicos

  • Antonio Horta IME
  • Ronaldo Goldschmidt IME
  • Ronaldo Salles IME
  • Anderson dos Santos IME

Resumo


No contexto do aprendizado de máquina de agentes em ataques cibernéticos, a eficiência considera questões relacionadas ao tempo de execução, à economia de recursos e às recompensas alcançadas nos treinamentos. O estado da arte é caracterizado pelo uso do aprendizado por reforço (RL) para o treinamento de agentes em ataques a cenários desconhecidos e dinâmicos. Entretanto, à natureza exploratória do RL, pode comprometer a eficiência no treinamento de agentes. Diante do exposto, a tese levanta a hipótese de que o treinamento de agentes para a execução de ataques cibernéticos, em cenários desconhecidos e dinâmicos, será mais eficiente ao incorporar a minimização das falhas do sequenciamento como o fator central da função recompensa do RL. Com o objetivo de tornar o treinamento de agentes mais eficiente no sequenciamento de técnicas que compõem um ataque cibernético, a tese propõe o algoritmo de RL Kill Chain Unscrambler (KCU). Sua arquitetura é baseada em uma lógica de árvores de decisão e incorpora o módulo catalisador Kill Chain Catalyst (KCC), inspirado no alinhamento genético, cuja função é priorizar o uso de sequências que acelerem o RL. Experimentos compararam o desempenho do KCU e do KCC, frente aos principais algoritmos de RL em um CTF. Os resultados indicaram um aprendizado mais eficiente para os agentes treinados com uso do KCU e do KCC.

Referências

Baker, B., Kanitscheider, I., Markov, T., Wu, Y., Powell, G., McGrew, B., and Mordatch, I. (2020). Emergent tool use from multi-agent autocurricula. In International Conference on Learning Representations (ICLR 2020).

Chen, J., Hu, S., Zheng, H., Xing, C., and Zhang, G. (2023). Gail-pt: An intelligent penetration testing framework with generative adversarial imitation learning. Computers Security, 126:103055.

Horta, A., dos Santos, A., and Goldschmidt, R. (2026). Enhancing red team agent learning with the kill chain catalyst algorithm in capture the flag scenarios. Journal of the Brazilian Computer Society, 32(1):289–304.

Horta, A., dos Santos, A. F. P., and Goldschmidt, R. R. (2025). Evaluating the stealth of reinforcement learning-based cyber attacks against unknown scenarios using knowledge transfer techniques. Journal of Computer Security, 33(2):100–115.

Horta, A., Santos, A., and Goldschmidt, R. (2024). Kill chain catalyst for autonomous red team operations in dynamic attack scenarios. In Anais do XXIV Simpósio Brasileiro de Segurança da Informação e de Sistemas Computacionais, pages 415–430, Porto Alegre, RS, Brasil. SBC.

Mcdonald, G., Li, L., and Mallah, R. A. (2024). Finding the optimal security policies for autonomous cyber operations with competitive reinforcement learning. IEEE Access, 12:120292 – 120305.

Oh, S. H., Kim, J., Nah, J. H., and Park, J. (2024). Employing deep reinforcement learning to cyber-attack simulation for enhancing cybersecurity. Electronics (Switzerland), 13(3).

Sutton, R. S. and Barto, A. G. (2018). Reinforcement learning: an introduction. MIT press, second edition.

Tavakkoli, N., Çetin, O., Ekmekcioglu, E., and Savaş, E. (2025). From frontlines to online: examining target preferences in the russia-ukraine conflict. International Journal of Information Security, 24(1):1–15.

Wang, C., Redino, C., Clark, R., Rahman, A., Aguinaga, S., Murli, S., Nandakumar, D., Rao, R., Huang, L., Radke, D., and Bowen, E. (2024). Leveraging reinforcement learning in red teaming for advanced ransomware attack simulations. In 2024 IEEE International Conference on Cyber Security and Resilience (CSR), pages 262–269.

Zhou, S., Liu, J., Hou, D., Zhong, X., and Zhang, Y. (2021). Autonomous penetration testing based on improved deep q-network. Applied Sciences, 11(19).

Zhou, Z., Zhou, T., Xu, J., and Zhu, J. (2024). Efficient penetration testing path planning based on reinforcement learning with episodic memory. CMES - Computer Modeling in Engineering and Sciences, 140(3):2613 – 2634.
Publicado
01/09/2026
HORTA, Antonio; GOLDSCHMIDT, Ronaldo; SALLES, Ronaldo; SANTOS, Anderson dos. Uma Abordagem para a Otimização do Aprendizado de Agentes Durante o Sequenciamento de Ataques Cibernéticos em Cenários Desconhecidos e Dinâmicos. In: CONCURSO DE TESES E DISSERTAÇÕES - SIMPÓSIO BRASILEIRO DE CIBERSEGURANÇA (SBSEG), 26. , 2026, Armação dos Búzios/RJ. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 65-72. DOI: https://doi.org/10.5753/sbseg_estendido.2026.31663.