Avaliação do Desempenho de LLMs Médios na Extração de Esquemas JSON: Um Estudo Empírico

  • Thiago C. Almeida Universidade Federal da Fronteira Sul (UFFS)
  • Denio Duarte Universidade Federal da Fronteira Sul (UFFS)
  • Geomar A. Schreiner Universidade Federal da Fronteira Sul (UFFS)
  • Samuel Feitosa Universidade Federal da Fronteira Sul (UFFS)

Resumo


Modelos de Linguagem de Grande Escala (LLMs) são amplamente utilizados em várias tarefas de processamento de linguagem natural, porém com alto custo computacional que limita o seu uso. Este estudo investiga o desempenho de LLMs de tamanho médio em relação ao número de parâmetros, especificamente Gemma 3-4B e Qwen 2.5-14B, na extração de esquemas de coleções JSON. O desempenho é avaliado pela corretude do esquema extraído (i.e., os documentos utilizados são válidos em relação ao esquema extraído) e o tempo total do processamento. Os resultados dos experimentos mostram que os modelos tiveram sucesso (taxa superior a 99%) em extrair esquemas JSON. Contudo, mesmo com modelos médios, o elevado custo computacional e o tempo de processamento ainda representam desafios significativos para a escalabilidade da solução em ambientes com recursos limitados.

Palavras-chave: Extração de Esquemas, Large Language Models, JSON, Aprendizado de Máquina, Extração de Dados

Referências

Abdelhedi, F., Brahim, A. A., Rajhi, H., Ferhat, R. T., and Zurfluh, G. (2021). Automatic extraction of a document-oriented nosql schema. In ICEIS (1), pages 192–199.

Baazizi, M.-A., Colazzo, D., Ghelli, G., and Sartiani, C. (2019). Parametric schema inference for massive JSON datasets. The VLDB Journal, 28:497–521.

Banhara, N., Schreiner, G. A., da Silva Feitosa, S., and Duarte, D. (2024). Enumeration, tagged unions, tuples, and collections: A novel approach to extracting json schema. In Simpósio Brasileiro de Banco de Dados (SBBD), pages 234–246. SBC.

Bender, E. M., Gebru, T., McMillan-Major, A., and Shmitchell, S. (2021). On the dangers of stochastic parrots: Can language models be too big? In Proceedings of the 2021 ACM conference on fairness, accountability, and transparency, pages 610–623.

Bouchou, B. and Duarte, D. (2007). Assisting XML schema evolution that preserve validity. In Brazilian Database Symposium, pages 270–284.

Bourhis, P., Reutter, J. L., Suárez, F., and Vrgoč, D. (2017). Json: data model, query languages and schema specification. In Proceedings of the 36th ACM SIGMOD-SIGACT-SIGAI symposium on principles of database systems, pages 123–135.

Dagdelen, J., Dunn, A., Lee, S., Walker, N., Rosen, A. S., Ceder, G., Persson, K. A., and Jain, A. (2024). Structured information extraction from scientific text with large language models. Nature Communications, 15(1):1418.

Frozza, A. A., dos Santos Mello, R., and da Costa, F. d. S. (2018). An approach for schema extraction of json and extended json document collections. In 2018 IEEE International Conference on Information Reuse and Integration (IRI), pages 356–363. IEEE.

Kellou-Menouer, K., Kardoulakis, N., Troullinou, G., Kedad, Z., Plexousakis, D., and Kondylakis, H. (2022). A survey on semantic schema discovery. The VLDB Journal, 31(4):675–710.

Klessinger, S., Klettke, M., Störl, U., and Scherzinger, S. (2023). Extracting JSON schemas with tagged unions. arXiv preprint arXiv:2306.07085.

Lima, M., Duarte, D., Schreiner, G., Salton, G., and Feitosa, S. (2024). Automated edge-case discovery in JSON schema validation: A differential testing approach powered by LLMs. TCC - UFFS.

Maiwald, B., Riedle, B., and Scherzinger, S. (2019). What are real json schemas like? In International Conference on Conceptual Modeling, pages 95–105. Springer.

Mior, M. J. (2024). Large language models for json schema discovery. arXiv preprint arXiv:2407.03286.

MongoDB Inc. (2024). Mongodb documentation. [link]. Acesso em: 13 maio 2025.

Namba, J. (2021). Enhancing json schema discovery by uncovering hidden data. In PhD@ VLDB.

Pezoa, F., Reutter, J. L., Suarez, F., Ugarte, M., and Vrgoč, D. (2016). Foundations of json schema. In Proceedings of the 25th international conference on World Wide Web, pages 263–273.

Silva, L. O., Silva, P. H., and Silva, F. A. (2025). Leis de escala para text-to-sql: Um estudo sobre a relação entre tamanho e desempenho de modelos de linguagem. In Simpósio Brasileiro de Banco de Dados (SBBD), pages 140–153. SBC.

Spoth, W., Kennedy, O., Lu, Y., Hammerschmidt, B., and Liu, Z. H. (2021). Reducing ambiguity in JSON schema discovery. In Proceedings of the 2021 SIGMOD.

Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., and Polosukhin, I. (2017). Attention is all you need. Advances in neural information processing systems, 30.

Wang, K. and Liu, H. (1997). Schema discovery for semistructured data. In KDD, volume 97, pages 271–274.

Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S., Yogatama, D., Bosma, M., Zhou, D., Metzler, D., Chi, E. H., Hashimoto, T., Vinyals, O., Liang, P., Dean, J., and Fedus, W. (2022). Emergent abilities of large language models. Transactions on Machine Learning Research.

Yun, J., Tak, B., and Han, W.-S. (2024). Recg: Bottom-up json schema discovery using a repetitive cluster-and-generalize framework. Proc. VLDB Endow., 17(11):3538–3550.
Publicado
08/09/2026
ALMEIDA, Thiago C.; DUARTE, Denio; SCHREINER, Geomar A.; FEITOSA, Samuel. Avaliação do Desempenho de LLMs Médios na Extração de Esquemas JSON: Um Estudo Empírico. In: SIMPÓSIO BRASILEIRO DE BANCO DE DADOS (SBBD), 41. , 2026, São Carlos/SP. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2026 . p. 57-70. ISSN 2763-8979. DOI: https://doi.org/10.5753/sbbd.2026.249140.