Zero-Shot Product Title Normalization with LLMs: A Multi-Model Evaluation

  • Humberto Nunes de Lira UFPB
  • Rômulo Henrique Nascimento Duarte UFPB
  • Beatriz Almeida de Souza Silva UNIPÊ
  • BrennoHenrique Alves da Silva Costa UFPB
  • Lucas Rabay Butcher UFPB
  • Fernando d’Ávila Lins Bezerra Cavalcanti Filho UFPB
  • Adriano Dias Jerônimo Filho UFPB

Resumo


A normalização de títulos de produtos é um desafio crítico de qualidade de dados em catálogos de e-commerce, onde vendedores independentes introduzem inconsistências severas que dificultam deduplicação e entity matching. Apresentamos o TAIL (Title Attribute Inference Layer), pipeline zero-shot baseado em LLM para extração de atributos, avaliado sobre três LLMs em um dataset de 1.200 pares anotados de um catálogo brasileiro de e-commerce. O desempenho de matching par-a-par depende do modelo de extração, variando de 0,44 a 0,78 F1, com apenas o melhor superando os baselines TF-IDF (+18,7 pontos de F1, IC 95% [+1,1; +37,3]), enquanto a constância varia de forma mais modesta. A escolha do modelo é tão crítica quanto o desenho do pipeline.

Referências

Brinkmann, A., Baumann, N., and Bizer, C. (2024). Using LLMs for the extraction and normalization of product attribute values. In Advances in Databases and Information Systems: 28th European Conference (ADBIS 2024), volume 14918 of Lecture Notes in Computer Science, pages 217–230. Springer Nature Switzerland.

Brinkmann, A., Shraga, R., and Bizer, C. (2023). Product attribute value extraction using large language models. arXiv preprint arXiv:2310.12537.

Fan, M., Han, X., Fan, J., Chai, C., Tang, N., Li, G., and Du, X. (2024). Cost-effective in-context learning for entity resolution: A design space exploration. In Proceedings of the 40th IEEE International Conference on Data Engineering (ICDE), pages 3696–3709.

Gazzola, M., Souto, H. G., Silva, S., Peixoto, J. S., Siqueira, F., Morais, A. L. P. d., and Gomes, C. (2025). AI-PAVE-Br: Leveraging large language models for enhanced product attribute value extraction through a golden set approach. In Anais do XVI Simpósio Brasileiro de Tecnologia da Informação e da Linguagem Humana (STIL), pages 149–160.

Li, Y., Li, J., Suhara, Y., Doan, A., and Tan, W.-C. (2020). Deep entity matching with pre-trained language models. Proceedings of the VLDB Endowment, 14(1):50–60.

More, A. (2016). Attribute extraction from product titles in ecommerce. arXiv preprint arXiv:1608.04670.

Neres de Sousa, J. V. C., Mingardo, L. M., Freire, C. E. T., Traina, A. J. M., and Junior, C. T. (2025). Agente autônomo guiado por LLM para extração de notícias. In Anais do XL Simpósio Brasileiro de Bancos de Dados (SBBD), pages 278–288.

Zhang, Z., Groth, P., Calixto, I., and Schelter, S. (2025). A deep dive into cross-dataset entity matching with large and small language models. In Proceedings of the 28th International Conference on Extending Database Technology (EDBT), pages 922–934.

Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E. P., Zhang, H., Gonzalez, J. E., and Stoica, I. (2023). Judging LLM-as-a-judge with MT-bench and chatbot arena. In Advances in Neural Information Processing Systems (NeurIPS), volume 36, pages 46595–46623.
Publicado
19/10/2026
LIRA, Humberto Nunes de; DUARTE, Rômulo Henrique Nascimento; SILVA, Beatriz Almeida de Souza; COSTA, BrennoHenrique Alves da Silva; BUTCHER, Lucas Rabay; CAVALCANTI FILHO, Fernando d’Ávila Lins Bezerra; JERÔNIMO FILHO, Adriano Dias. Zero-Shot Product Title Normalization with LLMs: A Multi-Model Evaluation. In: WORKSHOP-ESCOLA DE SISTEMAS DE AGENTES, SEUS AMBIENTES E APLICAÇÕES (WESAAC), 20. , 2026, Cuiabá/MT. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 336-347. ISSN 2326-5434. DOI: https://doi.org/10.5753/wesaac.2026.32092.