Detecção de Mensagens de Phishing Geradas por Modelos Generativos de Linguagem em Português por Meio de Atributos Estilométricos Resilientes a Vieses de Geração Sintética

Resumo


Este artigo investiga o potencial de um modelo preditivo baseado em estilometria comportamental para identificar phishing gerado por IA em Português. A metodologia foca na extração de atributos morfológicos, como comandos imperativos, para mitigar vieses de modelos sintéticos. Diante do cenário de dataset shift entre arquiteturas (Gemini e GPT-4o), avaliou-se um classificador XGBoost que alcançou F1-Score de 0,91 em ambiente controlado. Os resultados indicam que a análise estilométrica oferece indícios relevantes para complementar defesas tradicionais, embora a generalização em cenários reais ainda demande validação com dados orgânicos.

Referências

Alhaji, U. M., Adewumi, S. E., and Yemi-peters, V. I. (2025). Classification of phishing attacks using machine learning algorithms: A systematic literature review. Journal of Advances in Mathematics and Computer Science, 40(1):26–44.

Barik, K., Misra, S., et al. (2025). Web-based phishing url detection model using deep learning optimization techniques. International Journal of Data Science and Analytics, 20:4449–4471.

Bauskar, S. R., Madhavaram, C. R., Galla, E. P., Sunkara, J. R., and Gollangi, H. K. (2024). AI-driven phishing email detection: Leveraging big data analytics for enhanced cybersecurity. Library Progress International, 44(3):7211–7224.

Eze, C. S. and Shamir, L. (2024). Analysis and prevention of AI-based phishing email attacks. Electronics, 13(10):1839.

Heiding, F., Schneier, B., Vishwanath, A., Bernstein, J., and Park, P. S. (2024). Devising and detecting phishing emails using large language models. IEEE Access.

Martins, T. B. F., Ghiraldelo, C. M., Nunes, M. G. V., and Jr., O. N. O. (1996). Readability formulas applied to textbooks in brazilian portuguese. Technical Report 28, Instituto de Ciências Matemáticas de São Carlos, Universidade de São Paulo, São Carlos, SP, Brazil.

Opara, C., Modesti, P., and Golightly, L. (2025). Evaluating spam filters and stylometric detection of AI-generated phishing emails. Expert Systems With Applications, 276:127044.

Owa, K. and Adewole, O. (2025). Benchmarking machine learning techniques for phishing detection and secure URL classification. International Journal of Computer Science and Mobile Computing, 14(1):20–37.

Patil, R. R. et al. (2025). Design of intelligent feature selection technique for phishing detection. IIUM Engineering Journal, 26(1).

Patil, R. R., Kaur, G., Jain, H., Tiwari, A., Joshi, S., Rao, K., and Sharma, A. (2022). Machine learning approach for phishing website detection: A literature survey. Journal of Discrete Mathematical Sciences and Cryptography.

Saeed, E. M. H. (2025). An ensemble voting classifier based on machine learning models for phishing detection. International Journal of Scientific Research in Science, Engineering and Technology, 12(1):15–27.

Silva, R. R. and Pires, T. B. (2024). Olhares sobre a tradução automática: uma análise sobre o desempenho dos sistemas deepl e google tradutor. Revista Babel, 14:e20368.

Tang, L. and Mahmoud, Q. H. (2021). A survey of machine learning-based solutions for phishing website detection. Machine Learning and Knowledge Extraction, 3:679–702.
Publicado
01/09/2026
SILVA, Jeanderson Medeiros da; DUARTE, Jaqueline Damacena; MENDONCA, Fabio Lucio Lopes de; MELO, Laerte Peotta de. Detecção de Mensagens de Phishing Geradas por Modelos Generativos de Linguagem em Português por Meio de Atributos Estilométricos Resilientes a Vieses de Geração Sintética. In: SIMPÓSIO BRASILEIRO DE CIBERSEGURANÇA (SBSEG), 26. , 2026, Armação dos Búzios/RJ. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 502-517. DOI: https://doi.org/10.5753/sbseg.2026.27021.