• pi0 란?

    오늘은 Physical Intelligence에서 공개한 Black, Kevin, et al. “π0: A Vision-Language-Action Flow Model for General Robot Control” 논문을 리뷰해보겠습니다. 최근 로봇 분야에서 VLM(Vision-Language Model)에 Action을 결합한 VLA(Vision-Language-Action) 모델이 굉장히 많이 연구되고 있는데요. π0는 여기에 Flow Matching 을 적용하여 연속적인 로봇 Action을 생성하는 모델입니다. 이번 글에서는 제가 논문을 읽으면서 중요하다고 생각한...


  • VLANeXt란?

    지난 포스팅 에서는 Vision-Language-Action(VLA) 가 무엇인지, VLA가 어떤 방식으로 Vision, Language, Robot State를 실제 Action으로 연결하는지 전체적인 흐름을 살펴봤습니다. 이번에는 최근 읽어본 VLANeXt: Recipes for Building Strong VLA Models 논문을 정리해보겠습니다. 😄 이 논문이 재미있는 이유는 완전히 새로운 VLA 구조 하나를 제안하는 방식이 아니라는 점입니다. 현재 VLA 연구에는 정말 다양한...


  • Vision-Language-Action(VLA)란?

    오늘은 Vision-Language-Action(VLA) 에 대해서 이야기해보겠습니다. 최근 로보틱스 분야를 공부하다 보면 VLM(Vision-Language Model)과 함께 정말 자주 보이는 단어인데요!! 간단하게 이야기하면 VLA는 보고(Vision), 명령을 이해하고(Language), 실제 행동(Action)까지 생성하는 모델입니다. 이번 포스팅은 Sapkota, Ranjan, et al. “Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges” 논문을 중심으로 정리해보겠습니다. 이 논문은 최근 3년 동안 발표된...


  • Vision Transformer(ViT)란?

    오랜만에 인사드립니다! 현재 Vision Language Model에 공부를 시작하게 되었는데요. VLM의 중요한 내용인 Vision Transformer에 대해 이야기해보겠습니다. 오늘 소개드릴 논문은 Dosovitskiy, Alexey, et al. “An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.” ICLR 2021. 입니다. 이 논문은 Transformer를 비전 도메인에 직접 적용한 기념비적인 논문으로, 이후 CLIP, BLIP,...


  • Live Music Models 리뷰

    안녕하세요! 오늘은 Google DeepMind의 Lyria Team에서 발표한 “Live Music Models” 논문에 대해 리뷰를 해보겠습니다. 이 논문은 NeurIPS 2025 Creative AI Track에 게재된 논문으로, 실시간 라이브 음악 생성이라는 새로운 패러다임을 제시합니다. Introduction, Method, Experiments, Controllable Generation, Conclusion 순서로 이야기하겠습니다. Introduction 음악의 두 가지 형태 논문은 음악이 두 가지 상보적(complementary) 형태로 존재한다는...