Published on2026년 6월 29일로봇은 어떻게 배우는가 — 모방학습과 강화학습ai-papersroboticsimitation-learningreinforcement-learningrobot-learningvla로봇이 기술을 습득하는 네 가지 방식을 개괄하고, 모방학습(텔레오퍼레이션·행동 복제·DAgger)과 강화학습(보상·정책·탐험)의 원리와 장단점, 데이터 효율의 차이, 그리고 두 접근을 결합하는 방법을 다이어그램과 비교표로 정리합니다.
Published on2026년 6월 29일사람 영상에서 배우는 로봇 — 웹 스케일 데이터의 꿈ai-papersroboticsimitation-learningrepresentation-learningvideovla사람이 물건을 다루는 영상에서 로봇이 배울 수 있을까요. 어포던스와 궤적, 도메인 갭, 표현학습과 사전학습, 원샷 모방, 웹 비디오 스케일업, 그리고 로봇 데이터와의 결합까지 사례와 한계를 짚습니다.
Published on2026년 6월 27일Diffusion Policy와 π0 — 부드러운 로봇 행동의 비밀ai-papersroboticsdiffusion-policypi0flow-matchingimitation-learningmanipulation이산 액션 토큰의 한계를 넘어, 행동을 연속값으로 생성하는 두 흐름을 살펴봅니다. Diffusion Policy는 행동을 디노이징으로 생성하고, π0는 flow-matching으로 고주파 연속 액션을 만듭니다. 두 접근의 아이디어, 아키텍처, 제어 주파수, 강점과 한계를 정리합니다.