MODELO DE SÍNTESE DE VOZ CANTADA COM BASE EM MACHINE LEARNING

Autores

  • Fernando Parra Cano Faculdade de Tecnologia de Tatuí - FATEC
  • Luis Antonio Galhego Fernandes Faculdade de Tecnologia de Tatuí - FATEC
  • Otávio dos Santos Gaijutis Faculdade de Tecnologia de Tatuí - FATEC
  • Daniel Soares e Marques Faculdade de Tecnologia de Tatuí - FATEC

Resumo

Esta pesquisa apresenta um modelo de síntese de voz cantada baseado em machine learning. Aborda a interseção entre tecnologia e música, destacando a importância da síntese de voz cantada para a inovação na indústria musical e sua relevância. O objetivo geral do estudo é desenvolver um modelo que utilize aprendizado de máquina para gerar vozes cantadas. Os objetivos específicos incluem a pesquisa sobre técnicas de síntese de voz e a definição das etapas necessárias para a criação do modelo. A metodologia abrange a elaboração de um dataset, o treinamento do modelo e a conversão da voz, utilizando redes neurais profundas (DNN) para aprimorar a naturalidade e expressividade da síntese. A pesquisa aborda os avanços na síntese de voz, desde modelos tradicionais como os Modelos Ocultos de Markov (HMM) até abordagens modernas que incorporam inteligência artificial (IA). Os resultados demonstram que o uso de DNNs permite uma representação mais natural das nuances vocais, superando limitações das técnicas anteriores. O trabalho conclui que o desenvolvimento deste modelo abre novas possibilidades criativas para artistas, contribuindo assim para o avanço da pesquisa em inteligência artificial aplicada à música.

Biografia do Autor

  • Fernando Parra Cano, Faculdade de Tecnologia de Tatuí - FATEC

    Graduando em Produção Fonográfica pela FATEC Tatuí. Participou em 2022 de projeto de Monitoria de Iniciação em Desenvolvimento Tecnológico e Inovação intitulado “Breve levantamento sobre os conhecimentos necessários para desenvolvimento de plugin para áudio”, e, em 2023 de projeto de Monitoria de Iniciação em Desenvolvimento Tecnológico e Inovação intitulado “Etapas necessárias de pré-processamento de áudio para deep learning de síntese de voz cantada”, ambos sob orientação do professor Me. Luís Antônio Galhego Fernandes. Participou como apresentador do trabalho “Etapas necessárias de pré-processamento de áudio para deep learning de síntese de voz cantada” no 32º SIICUSP, ocorrido em 04 de outubro de 2024, na ICMC-USP São Carlos.

  • Luis Antonio Galhego Fernandes, Faculdade de Tecnologia de Tatuí - FATEC

    Possui graduação em Engenharia Naval com ênfase em Transportes pela Escola Politécnica da Universidade de São Paulo (1998) e mestrado em Engenharia Química pela Universidade Estadual de Campinas (2005). Experiência na iniciativa privada no cargo de gerência de engenharia e de produção, posteriormente atuou como diretor geral de uma empresa de consultoria em logística com projetos no Estado de São Paulo atuando ainda como palestrante na área de logística. Iniciou atividade de professor (concursado) no Centro Paula Souza em 2004, na FATEC Botucatu ministrando disciplinas nas áreas de Canais de Distribuição e Cadeia de Suprimentos, Gestão de Estoques, Movimentação e Armazenagem, Transportes e Métodos de Simulação em Logística. Ministrou a primeira aula da FATEC Tatuí. Idealizador e responsável pela implantação do primeiro curso de Tecnologia em Produção Fonográfica público do Brasil. Coordenador do curso de Tecnologia em Produção Fonográfica de agosto de 2010 até janeiro de 2018. Professor concursado da Faculdade de Tecnologia de Tatuí, categoria Professor de Ensino Superior, tendo ministrado as disciplinas de Cálculo I e Organização Industrial para o curso de Automação Industrial, as aulas de Métodos para Produção do Conhecimento e Fundamentos de Administração para o curso de Tecnologia em Produção Fonográfica e Logística e Sistemas de Apoio à Decisão para o curso de Gestão Empresarial. Sua atuação como pesquisador na área de logística e sustentabilidade rendeu, para os projetos de extensão associados à essa pesquisa, dois prêmios nacionais na área. Retornou em fevereiro de 2018 à condição de pesquisador com dedicação exclusiva da FATEC Tatuí, com foco no desenvolvimento regional do município que está inserido, fortalecendo a cena independente e música autoral com ações de marketing digital e logística da produção de eventos - abordando as metodologias ativas e atividades de extensão. Atualmente trabalha em um projeto de pesquisa com foco em Teoria de Aprendizagem para Adultos, intitulado Pesquisa sobre o Ensino Aprendizagem para Adultos com Foco no Ensino Tecnológico. Foi presidente e vice-presidente do Conselho Municipal de Políticas Culturais de Tatuí tendo participado do grupo de trabalho que elaborou o Plano Municipal de Cultura do município. É vice-presidente do conselhos de Turismo, tendo atuado neste conselho para que o município pudesse se integrar ao grupo do Municípios de Interesse Turístico (MIT) em 2017. Também participa do Conselho de Defesa do Patrimônio Histórico e Artístico de Tatuí. Integra ainda o Núcleo de Justiça Restaurativa de Tatuí na frente da Educação para a Paz em projeto com a Escola EMEF Profa. Eunice Pereira de Camargo, em conjunto com a Liga de Eventos da FATEC Tatuí.

  • Otávio dos Santos Gaijutis, Faculdade de Tecnologia de Tatuí - FATEC

    Otavio é natural de São Paulo, SP, atualmente com 45 anos. Graduou-se em Engenharia Elétrica pelo INATEL em 2002, passando a trabalhar em projetos de telecom, software e instalações elétricas. A partir de 2004 passou a atuar também como professor de ensino técnico, até 2014. E desde 2012 é docente na Fatec Tatuí, ensino superior, em disciplinas relacionadas a automação industrial, eletrônica de áudio, modelagem matemática de controle, e gestão de projetos. Em 2018 alcançou título de mestre em Engenharia Química pela FEQ/Unicamp. Também em 2018 finalizou um MBA em gestão de projetos pela Fatec São Paulo. Desde 2019 orienta na Fatec Tatuí o NIA - Núcleo de Inteligência Artificial, com projetos e workshops sobre programação (Python) de Redes Neurais Artificiais (RNA, ou ANN/DNN) e também Modelos Amplos de Linguagem (API de LLM/GPT).

  • Daniel Soares e Marques, Faculdade de Tecnologia de Tatuí - FATEC

    Mestre em Informática pelo PPGI UFPB (2012). Professor na FATEC Tatuí e FATEC Sorocaba. Suas pesquisas atuais surgem do interesse em desenvolvimento de ferramentas em hardware e software para Processamento de Áudio Digital e inserção da estética de ritmos de cultura popular na música eletrônica, procurando integrar suas raízes culturais, e práticas de movimento corporal, à ciência e tecnologia advindas de seu conhecimento acadêmico.

Referências

AGGARWAL, C. C. Neural networks and deep learning: a textbook. Springer, 2018. Disponível em: https://dlib.hust.edu.vn/bitstream/HUST/24439/1/OER000003177.pdf. Acesso em: 26 set. 2024.

AGGARWAL, K. et al. Has the future started? The current growth of artificial intelligence, machine learning, and deep learning. Iraqi Journal for Computer Science and Mathematics, v. 3, n. 1, p. 115-123, 2022. Disponível em: https://www.iasj.net/iasj/download/cefbfd60eb11898a. Acesso em: 25 maio 2024.

ARDAILLON, L. Synthesis and expressive transformation of singing voice. 2017. 249 f. Tese (Doutorado) – Université Pierre et Marie Curie – Paris VI, Paris, 2017. Disponível em: https://hal.science/tel-01710926/file/2017PA066511.pdf. Acesso em: 19 maio 2024.

BOCK, C. Vocal Synthesizers: 4 Ways to Create Synthetic Voices and How to Use Them. 2024. Disponível em: https://babyaud.io/blog/vocal-synthesizers. Acesso em: 26 set. 2024.

BRUM, L. A. Z. Patricia: um sintetizador de canto em tempo real para o português brasileiro. 2023. 113 f. Trabalho de Conclusão de Curso (Graduação em Música) – Universidade Federal de Sergipe, São Cristóvão, 2023. Disponível em: https://ri.ufs.br/bitstream/riufs/19472/2/LEONARDO_ARAUJO_ZOEHLER_BRUM.pdf. Acesso em: 17 jul. 2026.

CHOI, S. Singing voice Synthesis. Disponível em: https://mac.kaist.ac.kr/singing_voice_synthesis.html. Acesso em: 19 maio 2024.

CICHY, R. M.; KAISER, D. Deep neural networks as scientific models. Trends in cognitive sciences, v. 23, n. 4, p. 305-317, 2019. Disponível em: https://www.sciencedirect.com/science/article/abs/pii/S1364661319300348. Acesso em: 25 set. 2024.

COCHARD, D. RVC: An AI-Powered Voice Changer. 2024. Disponível em: https://medium.com/axinc-ai/rvc-an-ai-powered-voice-changer-39927cc83bee. Acesso em: 13 out. 2024.

EVANGELISTA, L. A. de O. Uso de redes neurais generativas para síntese de voz: estudo e revisão de literatura. 2022. 34 f. Monografia (Bacharelado em Ciência da Computação) – Instituto de Matemática e Estatística, Universidade de São Paulo, São Paulo, 2022. Disponível em: https://www.linux.ime.usp.br/~luneomena/mac0499/TCC_monografia-10.pdf. Acesso em: 17 jul. 2026.

EDDY, S. R. Hidden markov models. Current opinion in structural biology, v. 6, n. 3, p. 361-365, 1996. Disponível em: https://courses.cs.duke.edu/fall14/compsci260/resources/HMM/eddy96.pdf. Acesso em 22 set. 2024.

FIUZA, M. A tecnologia no auxílio do canto. 2017. Disponível em: https://www.estudiodevoz.com.br/2017/09/a-tecnologia-no-auxilio-do-canto.html. Acesso em: 13 out. 2024.

GHAHRAMANI, Z. An introduction to hidden Markov models and Bayesian networks. International journal of pattern recognition and artificial intelligence, v. 15, n. 01, p. 9-42, 2001. Disponível em: https://i2pc.es/coss/Docencia/SignalProcessingReviews/Ghahramani2001.pdf. Acesso em 24 set. 2024.

KOHLSCHEIN, C. An introduction to hidden Markov models. In: Probability and Randomization in Computer Science. Seminar in winter semester. 2006. Disponível em: https://citeseerx.ist.psu.edu/document?repid=rep1&type=pdf&doi=c04443dfd58a816e821fc5278d3e0d5857f7d800. Acesso em: 22 set. 2024.

KIM, J. et al. Korean singing voice synthesis system based on an LSTM recurrent neural network. In: Proc. Interspeech. 2018. p. 1551-1555. Disponível em: https://www.isca-archive.org/interspeech_2018/kim18b_interspeech.pdf. Acesso em: 22 maio 2024.

KLEINA, O. A diferença entre machine learning e deep learning. 2023. Disponível em:https://posdigital.pucpr.br/blog/machine-learning-deep-learning. Acesso em: 26 set. 2024.

LAM, K. Y. The Hatsune Miku Phenomenon: More Than a Virtual J-Pop Diva. Journal of Popular Culture, v. 49, n. 5, 2016. Disponível em: https://scholars.cityu.edu.hk/en/publications/the-hatsune-miku-phenomenon-more-than-a-virtual-j-pop-diva/. Acesso em: 17 jul. 2026.

MONTAVON, G.; SAMEK, W.; MÜLLER, K-R. Methods for interpreting and understanding deep neural networks. Digital signal processing, v. 73, p. 1-15, 2018. Disponível em: https://www.sciencedirect.com/science/article/pii/S1051200417302385. Acesso em: 22 maio 2024.

NISHIMURA, Masanari et al. Singing Voice Synthesis Based on Deep Neural Networks. In: Interspeech. 2016. p. 2478-2482. Disponível em: https://www.isca-archive.org/interspeech_2016/nishimura16_interspeech.pdf. Acesso em: 22 maio 2024.

PEREIRA, F. Machine Learning: Um guia atualizado! 2023. Disponível em: https://www.dataex.com.br/machine-learning-um-guia-atualizado/. Acesso em: 26 set. 2024.

RADICH, Q.; JENKS, A.; COWLEY, E. O que é um modelo de machine learning? 2024. Disponível em: https://learn.microsoft.com/pt-br/windows/ai/windows-ml/what-is-a-machine-learning-model. Acesso em: 26 set. 2024.

SKANSI, S. Introduction to Deep Learning: from logical calculus to artificial intelligence. Springer, 2018.

TOMKINSON, S. This kind of life has no meaning: Neru’s Vocaloid Album CYNICISM. M/C Journal, v. 27, n. 2, 2024. Disponível em: https://journal.media-culture.org.au/index.php/mcjournal/article/view/3037. Acesso em 29 set. 2024.

WALDEN, J. Dreamtonics Synthesizer V. 2023. Disponível em: https://www.soundonsound.com/reviews/dreamtonics-synthesizer-v. Acesso em: 29 set. 2024.

Downloads

Publicado

2026-07-31