• Multi-Scale Sub-band CQT Discriminator리뷰

    너무 오랜만에 포스팅입니다. 그 동안 논문 작성, 실험, 새로운 연구 주제 선정 등 많은 일들을 하다보니 시간이 이렇게 흘렀습니다. 그 과정에서 제 모델을 깃허브 에 공개했고, Huggingface에서 연락도 오고, 다른 연구자가 문의도 하고 정말 제가 연구자가 된 것 같은 기분이 들었습니다.😊 그 과정에서 다른 연구자가 제 깃허브를 보고 제안한 방법이...


  • Flow Matching for Generative Modeling 리뷰

    오늘은 Flow Matching에 대해서 이야기 해보도록 하겠습니다. 어떤 모델에 대한 논문을 읽을 때는 벽을 느끼진 않았는데, 이 논문을 처음 읽었을 때는 정말 벽을 느꼈습니다.😥 그만큼 수학이 중요하다 생각이 드는 요즘입니다… 그래도 최대한 이야기해보도록 하겠습니다!! Flow Matching for Generative Modeling(Yaron Lipman et al. 2022) 논문에서 나온 내용입니다. 논문의 저자가 직접 논문을...


  • ETTA: Elucidating the Design Space of Text-to-Audio Models리뷰

    오늘은 Sang-gil Lee, et al. “ETTA: Elucidating the Design Space of Text-to-Audio Models” 논문을 리뷰하겠습니다. INTRODUCTION Text-to-Audio(TTA)모델의 셜계 공간은 복잡하며, 수많은 상관 관계가 있는 요인이 포함됩니다. 이 논문에서도 설계 공간과 각 요인의 기여도를 이해하려고 시도했지만, 실험 간 결론 도출을 하는 데에는 실패했습니다. 이 논문에서는 TTA 모델을 구축하기 위한 기존 패러다임의...


  • MelFusion 이란?

    오늘은 Chowdhury, Sanjoy, et al. “Melfusion: Synthesizing music from image and language cues using diffusion models.” 논문에서 소개한 MelFusion이라는 모델에 대해 이야기해보겠습니다. 이 논문은 탑 티어 컨퍼런스인 CVPR에서 Highlight, Top 2.8%의 엄청난 논문입니다! 한 번 같이 보겠습니다. Introduction, Method, Experiments and Results, Discussion 순서로 이야기하겠습니다. (기존 오디오 및 음악 생성형...


  • FLUX that Plays Music리뷰

    오늘은 Fei, Zhengcong, et al. “Flux that plays music.”(2024) 논문 리뷰를 해보겠습니다. 바로 시작해보겠습니다. Introduction Text-to-Music은 주로 언어 모델 또는 확산(Diffusion) 모델을 활용합니다. 대표적으로 MusicLM, MusicGen, AudioLDM 등이 있습니다. (첨언: 여기서 이야기 하는 언어모델은 Transformer입니다!! Transformer는 언어모델에서 출발했지만 여러 분야에 사용됩니다.) 확산 모델은 고차원 데이터를 효과적으로 모델링하여 음악 생성에 강력한...