• VAE(Variational autoencoder)란?

    오늘은 VAE(Variational autoencoder)에 대해서 이야기해보겠습니다. VAE에 대해 처음으로 소개한 논문은 Kingma와 Welling에 의해 2013년에 작성된 “Auto-Encoding Variational Bayes”입니다. 이 논문에서는 VAE의 기본 원리와 함께, 딥러닝을 이용한 변분 베이지안 추론(Variable Bayesian Inferench)의 새로운 방법을 제시했습니다. 이 논문은 VAE의 이론적 기반을 마련하고, 다양한 분야에서의 응용 가능성을 열어준 중요한 작업으로 평가받고 있습니다. 수식적으로...


  • HiFi-GAN 이란?

    오늘 주제는 HiFi GAN입니다. HiFi는 high-fidelity의 줄임말로 “음향에서 원음과 원화에 충실한 재현”의 뜻을 갖고 있습니다. 오늘은 다음 논문의 내용을 리뷰하고 정리하여 HiFi GAN에 대하여 설명해보겠습니다. Kong, J., Kim, J., & Bae, J. (2020). Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis. Advances in Neural Information Processing Systems,...


  • 스펙트로그램 & 멜-스펙트로그램 with Python

    오늘은 스펙트로그램과 멜-스펙트로그램을 Python에서 다루어보도록 하겠습니다. 설 연휴가 끝나고 오랜만에 게시글을 올리는 만큼 무겁지 않은 주제로 가져와봤습니다😃😃 지난번 FFT with Python 에서 같이 FFT를 적용하고 시간 도메인과 주파수 도메인에서 스펙트럼을 확인해봤었죠?? 이번엔 스펙트럼과 함께 스펙트로그램, 멜-스펙트로그램을 한 눈에 볼 수 있는 Python 코드를 실습해보겠습니다. 먼저 멜-스펙트로그램을 보기 위해서는 librosa 라이브러리를...


  • Diffusion 설명

    최근 오디오 생성형 AI 모델에 대한 연구가 활발히 진행중입니다. 그 중에서도 가장 최신 모델인 Auffusion과 AudioLDM2에 대한 논문을 보았는데요. 각 모델에 대한 자세한 정보는 링크를 타고 들어가시면 볼 수 있습니다. 두 모델 모두 Diffusion, HiFi-GAN, Transformer, VAE 등 공통적으로 알아야할 내용들이 있습니다. 그래서 이번 게시글에서는 먼저 공통적으로 알아야할 내용중 Diffusion에...


  • Mel-Spectrogram&MFCC 비교(with Cepstrum)

    오늘은 멜-스펙트로그램(Mel-Spectrogram)과 MFCC에 대해서 이야기해보겠습니다!! 그러기 위해서 알아야 할 것!! 지난번 음성 신호 처리 기초에서 Envelop에 대해 공부했었죠? 마지막에 Cepstrum(캡스트럼)에 대해 이야기 해보겠다 했는데요. MFCC를 이해하기 위해서 Cepstrum의 개념이 필요합니다!! 이번 게시글에서 Cepstrum의 개념도 함께 공부해보도록 하겠습니다. 캡스트럼(Cepstrum) \[1) s[n] = x[n]*h[n]\] \[2) S(f) = X(f)H(f)\] 이 사진과 공식 기억나시나요??...