Diferenciação de Ataques em Português e em Inglês: Análise de Experimento sobre as Barreiras Linguísticas no Alinhamento de LLMs

  • Bruno Zimmermann Russo Ferreira USP
  • Victor Takashi Hayashi USP

Resumo


Este artigo compara a taxa de sucesso de jailbreak do Llama 3.1 8B em prompts equivalentes em inglês e português, julgados pelo Llama 3.3 e curados manualmente. O ASR curado foi maior em português (16%) do que em inglês (10%), mas o achado principal é que o juiz LLM deixa passar muito mais jailbreaks em português – quatro vezes mais que em inglês – revelando um viés de calibração por idioma na avaliação automatizada de segurança.

Referências

Chao, P., Robey, A., Dobriban, E., Hassani, H., Pappas, G. J., and Wong, E. (2025). Jailbreaking black box large language models in twenty queries. In 2025 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML), pages 23–42. IEEE.

De Oliveira, D. E. G. C., Miers, C. C., Simplicio, M. A., and Hayashi, V. T. (2025). Between generation and judgment: A cloud-native framework for adversarial evaluation of llm alignment. In 2025 IEEE International Conference on Cloud Computing Technology and Science (CloudCom), pages 1–8.

Figueiredo, A. C. (2025). Ataque adversarial em modelos de linguagem para a língua portuguesa. Dissertação de mestrado, UNIRio. Disponível em: [link].

Khoboko, P. W., Marivate, V., and Sefara, J. (2025). Optimizing translation for low-resource languages: Efficient fine-tuning with custom prompt engineering in large language models. Machine Learning with Applications, 20:100649.

Mazeika, M., Phan, L., Yin, X., Zou, A., Wang, Z., Mu, N., Sakhaee, E., Li, N., Basart, S., Li, B., Forsyth, D., and Hendrycks, D. (2024). Harmbench: a standardized evaluation framework for automated red teaming and robust refusal. In ICML.

Miers, C. C., Jr., M. A. S., Rojas, M. A. T., de Oliveira, D. E. G. C., Neto, M. P. P., Damin, F. A. S., Jr., R. B., and Hayashi, V. T. (2024). Ferramentas de jailbreaking para grandes modelos de línguas – aprendizado de máquina no contexto adversário. In Minicursos do XXIV Simpósio Brasileiro de Segurança da Informação e de Sistemas Computacionais (SBSeg 2024), pages 49–91. Sociedade Brasileira de Computação.

Queiroz, J. (2026). Versificação adversarial em português como operador de jailbreak em llms. SciELO Preprints.

Vassilev, A., Oprea, A., Fordyce, A., Anderson, H., Davies, X., and Hamin, M. (2025). Adversarial machine learning: A taxonomy and terminology of attacks and mitigations. Technical report, NIST AI 100-2e2025.

Yuan, Y., Jiao, W., Wang, W., Huang, J.-t., He, P., Shi, S., and Tu, Z. (2024). Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher. In International Conference on Learning Representations, volume 2024, pages 53902–53922.
Publicado
01/09/2026
FERREIRA, Bruno Zimmermann Russo; HAYASHI, Victor Takashi. Diferenciação de Ataques em Português e em Inglês: Análise de Experimento sobre as Barreiras Linguísticas no Alinhamento de LLMs. In: WORKSHOP DE CIBERSEGURANÇA EM IA - SIMPÓSIO BRASILEIRO DE CIBERSEGURANÇA (SBSEG), 26. , 2026, Armação dos Búzios/RJ. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 1032-1035. DOI: https://doi.org/10.5753/sbseg_estendido.2026.33788.

Artigos mais lidos do(s) mesmo(s) autor(es)