MODELO DE SÍNTESE DE VOZ CANTADA COM BASE EM MACHINE LEARNING
Resumo
Esta pesquisa apresenta um modelo de síntese de voz cantada baseado em machine learning. Aborda a interseção entre tecnologia e música, destacando a importância da síntese de voz cantada para a inovação na indústria musical e sua relevância. O objetivo geral do estudo é desenvolver um modelo que utilize aprendizado de máquina para gerar vozes cantadas. Os objetivos específicos incluem a pesquisa sobre técnicas de síntese de voz e a definição das etapas necessárias para a criação do modelo. A metodologia abrange a elaboração de um dataset, o treinamento do modelo e a conversão da voz, utilizando redes neurais profundas (DNN) para aprimorar a naturalidade e expressividade da síntese. A pesquisa aborda os avanços na síntese de voz, desde modelos tradicionais como os Modelos Ocultos de Markov (HMM) até abordagens modernas que incorporam inteligência artificial (IA). Os resultados demonstram que o uso de DNNs permite uma representação mais natural das nuances vocais, superando limitações das técnicas anteriores. O trabalho conclui que o desenvolvimento deste modelo abre novas possibilidades criativas para artistas, contribuindo assim para o avanço da pesquisa em inteligência artificial aplicada à música.
Referências
AGGARWAL, C. C. Neural networks and deep learning: a textbook. Springer, 2018. Disponível em: https://dlib.hust.edu.vn/bitstream/HUST/24439/1/OER000003177.pdf. Acesso em: 26 set. 2024.
AGGARWAL, K. et al. Has the future started? The current growth of artificial intelligence, machine learning, and deep learning. Iraqi Journal for Computer Science and Mathematics, v. 3, n. 1, p. 115-123, 2022. Disponível em: https://www.iasj.net/iasj/download/cefbfd60eb11898a. Acesso em: 25 maio 2024.
ARDAILLON, L. Synthesis and expressive transformation of singing voice. 2017. 249 f. Tese (Doutorado) – Université Pierre et Marie Curie – Paris VI, Paris, 2017. Disponível em: https://hal.science/tel-01710926/file/2017PA066511.pdf. Acesso em: 19 maio 2024.
BOCK, C. Vocal Synthesizers: 4 Ways to Create Synthetic Voices and How to Use Them. 2024. Disponível em: https://babyaud.io/blog/vocal-synthesizers. Acesso em: 26 set. 2024.
BRUM, L. A. Z. Patricia: um sintetizador de canto em tempo real para o português brasileiro. 2023. 113 f. Trabalho de Conclusão de Curso (Graduação em Música) – Universidade Federal de Sergipe, São Cristóvão, 2023. Disponível em: https://ri.ufs.br/bitstream/riufs/19472/2/LEONARDO_ARAUJO_ZOEHLER_BRUM.pdf. Acesso em: 17 jul. 2026.
CHOI, S. Singing voice Synthesis. Disponível em: https://mac.kaist.ac.kr/singing_voice_synthesis.html. Acesso em: 19 maio 2024.
CICHY, R. M.; KAISER, D. Deep neural networks as scientific models. Trends in cognitive sciences, v. 23, n. 4, p. 305-317, 2019. Disponível em: https://www.sciencedirect.com/science/article/abs/pii/S1364661319300348. Acesso em: 25 set. 2024.
COCHARD, D. RVC: An AI-Powered Voice Changer. 2024. Disponível em: https://medium.com/axinc-ai/rvc-an-ai-powered-voice-changer-39927cc83bee. Acesso em: 13 out. 2024.
EVANGELISTA, L. A. de O. Uso de redes neurais generativas para síntese de voz: estudo e revisão de literatura. 2022. 34 f. Monografia (Bacharelado em Ciência da Computação) – Instituto de Matemática e Estatística, Universidade de São Paulo, São Paulo, 2022. Disponível em: https://www.linux.ime.usp.br/~luneomena/mac0499/TCC_monografia-10.pdf. Acesso em: 17 jul. 2026.
EDDY, S. R. Hidden markov models. Current opinion in structural biology, v. 6, n. 3, p. 361-365, 1996. Disponível em: https://courses.cs.duke.edu/fall14/compsci260/resources/HMM/eddy96.pdf. Acesso em 22 set. 2024.
FIUZA, M. A tecnologia no auxílio do canto. 2017. Disponível em: https://www.estudiodevoz.com.br/2017/09/a-tecnologia-no-auxilio-do-canto.html. Acesso em: 13 out. 2024.
GHAHRAMANI, Z. An introduction to hidden Markov models and Bayesian networks. International journal of pattern recognition and artificial intelligence, v. 15, n. 01, p. 9-42, 2001. Disponível em: https://i2pc.es/coss/Docencia/SignalProcessingReviews/Ghahramani2001.pdf. Acesso em 24 set. 2024.
KOHLSCHEIN, C. An introduction to hidden Markov models. In: Probability and Randomization in Computer Science. Seminar in winter semester. 2006. Disponível em: https://citeseerx.ist.psu.edu/document?repid=rep1&type=pdf&doi=c04443dfd58a816e821fc5278d3e0d5857f7d800. Acesso em: 22 set. 2024.
KIM, J. et al. Korean singing voice synthesis system based on an LSTM recurrent neural network. In: Proc. Interspeech. 2018. p. 1551-1555. Disponível em: https://www.isca-archive.org/interspeech_2018/kim18b_interspeech.pdf. Acesso em: 22 maio 2024.
KLEINA, O. A diferença entre machine learning e deep learning. 2023. Disponível em:https://posdigital.pucpr.br/blog/machine-learning-deep-learning. Acesso em: 26 set. 2024.
LAM, K. Y. The Hatsune Miku Phenomenon: More Than a Virtual J-Pop Diva. Journal of Popular Culture, v. 49, n. 5, 2016. Disponível em: https://scholars.cityu.edu.hk/en/publications/the-hatsune-miku-phenomenon-more-than-a-virtual-j-pop-diva/. Acesso em: 17 jul. 2026.
MONTAVON, G.; SAMEK, W.; MÜLLER, K-R. Methods for interpreting and understanding deep neural networks. Digital signal processing, v. 73, p. 1-15, 2018. Disponível em: https://www.sciencedirect.com/science/article/pii/S1051200417302385. Acesso em: 22 maio 2024.
NISHIMURA, Masanari et al. Singing Voice Synthesis Based on Deep Neural Networks. In: Interspeech. 2016. p. 2478-2482. Disponível em: https://www.isca-archive.org/interspeech_2016/nishimura16_interspeech.pdf. Acesso em: 22 maio 2024.
PEREIRA, F. Machine Learning: Um guia atualizado! 2023. Disponível em: https://www.dataex.com.br/machine-learning-um-guia-atualizado/. Acesso em: 26 set. 2024.
RADICH, Q.; JENKS, A.; COWLEY, E. O que é um modelo de machine learning? 2024. Disponível em: https://learn.microsoft.com/pt-br/windows/ai/windows-ml/what-is-a-machine-learning-model. Acesso em: 26 set. 2024.
SKANSI, S. Introduction to Deep Learning: from logical calculus to artificial intelligence. Springer, 2018.
TOMKINSON, S. This kind of life has no meaning: Neru’s Vocaloid Album CYNICISM. M/C Journal, v. 27, n. 2, 2024. Disponível em: https://journal.media-culture.org.au/index.php/mcjournal/article/view/3037. Acesso em 29 set. 2024.
WALDEN, J. Dreamtonics Synthesizer V. 2023. Disponível em: https://www.soundonsound.com/reviews/dreamtonics-synthesizer-v. Acesso em: 29 set. 2024.