Abordagem Híbrida para Reconhecimento Ótico de Música com Detecção de Objetos e LLMs Multimodais

  • Gustavo Henrique Romão UFSJ
  • Hygor Santiago Lara Unicamp
  • Jesuliana Nascimento Ulysses UFSJ

Resumo


Este estudo propõe uma abordagem híbrida para OMR, integrando modelos multimodais de linguagem (LLMs) com técnicas modernas de detecção de objetos. Para o reconhecimento de claves foi utilizado o Gemini 2.0 Flash, aproveitando sua capacidade de interpretação visual e contextual, enquanto YOLOv8 e YOLOv11 foram adotados para o processamento da detecção de valores de altura e ritmo. Esta divisão de tarefas reduz a complexidade da detecção de objetos, permitindo que os modelos YOLO se concentrem na localização precisa e classificação de símbolos musicais. A metodologia proposta apresentou resultados satisfatório na tarefa de reconhecimento de partituras monofônicas digitais, com o YOLOv11 atingindo um mAP50 de 0.995 quando a detecção de claves é realizada por meio de LLMs. reconhecimento óptico de música, aprendizado profundo, detecção de objetos, LLMs multimodais, YOLO, transcrição musical.

Referências

S. Yin, C. Fu, S. Zhao, K. Li, X. Sun, T. Xu, and E. Chen. A survey on multimodal large language models. arXiv pre-print arXiv:2306.13549, 2023.

Y.-H. Cao, K. Ji, Z. Huang, C. Zheng, J. Liu, J. Wang, J. Chen, and M. Yang. Towards better vision-inspired vision-language models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 13537–13547, 2024.

A. Pacha, J. Hajič Jr., and J. Calvo-Zaragoza. A baseline for general music object detection with deep learning. Applied Sciences, 8(9):1488, 2018.

J. Redmon, S. Divvala, R. Girshick, and A. Farhadi. You only look once: Unified, real-time object detection. arXiv preprint arXiv:1506.02640, 2016.

C. Li, C. Wong, S. Zhang, N. Usuyama, H. Liu, J. Yang, T. Naumann, H. Poon, and J. Gao. Llava-med: Training a large language-and-vision assistant for biomedicine in one day. Advances in Neural Information Processing Systems, 36, 2023.

E. van der Wel and K. Ullrich. Optical music recognition with convolutional sequence-to-sequence models. Zenodo, 2017.

L. Tuggener, I. Elezi, J. Schmidhuber, and T. Stadelmann. Deep watershed detector for music object recognition. arXiv preprint arXiv:1805.10548, 2018.

D. Reis, J. Kupec, J. Hong, and A. Daoudi. Real-time flying object detection with yolov8. arXiv preprint arXiv:2305.09972, 2023.

R.-Y. Ju and W. Cai. Fracture detection in pediatric wrist trauma x-ray images using yolov8 algorithm. Scientific Reports, 13:10375, 2023.

J. Calvo-Zaragoza and D. Rizo. End-to-end neural optical music recognition of monophonic scores. Applied Sciences, 8(4):606, 2018.

A. Ríos-Vila, J. Calvo-Zaragoza, and T. Paquet. Sheet music transformer: End-to-end optical music recognition beyond monophonic transcription. Journal of New Music Research, 2024.
Publicado
15/09/2025
ROMÃO, Gustavo Henrique; LARA, Hygor Santiago; ULYSSES, Jesuliana Nascimento. Abordagem Híbrida para Reconhecimento Ótico de Música com Detecção de Objetos e LLMs Multimodais. In: SIMPÓSIO BRASILEIRO DE COMPUTAÇÃO MUSICAL (SBCM), 19. , 2025, Campinas/SP. Anais [...]. Porto Alegre: Sociedade Brasileira de Computação, 2025 . p. 21-24. DOI: https://doi.org/10.5753/sbcm_estendido.2025.14777.