Avaliação de Táticas de Red Teaming Automatizado em Modelos de Linguagem de Pequeno Porte (SLMs)

  • Martony Demes da Silva UFPI
  • Guilherme Henrique Vieira de Alencar IFPI
  • Cleonildo Macedo de Macedo UFPI

Resumo


Modelos de Linguagem de Pequeno Porte (SLMs) enfrentam crescentes desafios de segurança relacionados a ataques de injeção de prompt. Este trabalho apresenta uma avaliação empírica automatizada de táticas de red teaming aplicadas aos modelos Qwen2.5-1.5B-Instruct e SmolLM2-1.7B-Instruct. Utilizando um classificador especializado (DistilBERT) como juiz automatizado, foram avaliados 60 vetores de ataque divididos em quatro categorias. Os resultados apontam uma Taxa de Sucesso de Ataque (ASR) global de 45,00% para o Qwen2.5 e 61,67% para o SmolLM2, evidenciando variações significativas de resiliência no alinhamento pós-treinamento entre as arquiteturas.

Referências

Abdin, M., Aneja, J., Awadalla, H., Awadallah, A., Awan, A., Bach, N., Bahree, A., Bakhtiari, A., Behl, H., Benhaim, A., et al. (2024). Phi-3 technical report: A highly capable language model locally on your phone. arXiv preprint arXiv:2404.14219.

Allal, L. B., Lozhkov, A., Penedo, G., Wolf, T., and von Werra, L. (2024). Smollm2: Smarter, faster, open small language models. [link].

Kumar, A., Agarwal, C., Srinivas, S., Sojoudi, S., and Jha, S. (2023). Certifying llm safety against adversarial prompting. arXiv preprint arXiv:2309.02701.

Liu, Y., Jia, Y., Geng, X., Jiao, J., Wang, S., and Zhang, X. (2023). Prompt injection attacks and defenses in llm-integrated applications. arXiv preprint arXiv:2310.12815.

Perez, F. and Ribeiro, I. (2022). Ignore previous instructions: Intentional redirection attacks on large language models. NeurIPS Workshop on AI Safety.

Shen, X., Chen, Z., Backes, M., Shen, Y., and Zhang, Y. (2023). ”do anything now”: Characterizing and evaluating in-the-wild jailbreak prompts on large language models. arXiv preprint arXiv:2308.03825.

Touvron, H., Martin, L., Stone, K., Albert, P., Almahairi, A., Babaei, Y., Bashlykov, N., Batra, S., Bhargava, P., Bhosale, S., et al. (2023). Llama 2: Open foundation and fine-tuned chat models. arXiv preprint arXiv:2307.09288.

Wang, B., Xu, C., Wang, S., Gan, Z., Cheng, Y., Jiang, J., and Liu, J. (2021). Advglue: A multi-task benchmark for robustness evaluation of language models. In NeurIPS Benchmarks and Datasets Track.

Wei, A., Haghtalab, N., and Steinhardt, J. (2023). Jailbroken: How does llm safety training fail? Advances in Neural Information Processing Systems, 36:80079–80110.

Yang, A., Yang, B., Hui, B., Zheng, B., Yu, B., Zhou, C., Li, C., Li, C., Liu, D., Huang, F., et al. (2024). Qwen2.5 technical report. arXiv preprint arXiv:2412.15115.

Zhang, W., Xu, H., Wang, Z., He, Z., Zhu, Z., and Ren, K. (2025). Can small language models reliably resist jailbreak attacks? a comprehensive evaluation. arXiv preprint arXiv:2503.06519.

Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E., et al. (2023). Judging llm-as-a-judge with mt-bench and chatbot arena. Advances in Neural Information Processing Systems, 36:46595–46623.
Publicado
01/09/2026
SILVA, Martony Demes da; ALENCAR, Guilherme Henrique Vieira de; MACEDO, Cleonildo Macedo de. Avaliação de Táticas de Red Teaming Automatizado em Modelos de Linguagem de Pequeno Porte (SLMs). In: WORKSHOP DE CIBERSEGURANÇA EM IA - SIMPÓSIO BRASILEIRO DE CIBERSEGURANÇA (SBSEG), 26. , 2026, Armação dos Búzios/RJ. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 1000-1007. DOI: https://doi.org/10.5753/sbseg_estendido.2026.33702.

Artigos mais lidos do(s) mesmo(s) autor(es)