전체 글 197

[논문 리뷰 #79] Semantic Handoff, 따로는 잘하는 VLA skill 이 이어 붙이면 멈추는 지점을 진단한 논문을 읽고

이번에 읽은 논문은 Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition 이다. SimpleAI 에서 낸 논문이다. 제목이 길지만 다루는 질문은 하나다. 각각 잘 학습된 VLA skill 을 agent 가 차례로 불러 긴 가사 작업을 시킬 때, 왜 작업 전체는 거의 성공하지 못하는가. 논문은 이 질문에 성능을 올리는 방법이 아니라 실패를 나눠 보는 방법으로 답한다. 논문 스스로 BEHAVIOR-1K 에서 state-of-the-art task 성공을 주장하려는 것이 아니라고 밝히고, long-horizon rollout 이 실패할 때 agent harness 가 무엇을 드러낼 수 ..

논문 리뷰 13:58:56

[논문 리뷰 #78] Sample, Simulate, Select, 학습 없이 로봇이 실제로 해낸 동작을 고르는 방법을 읽고

이번에 읽은 논문은 Sample, Simulate, Select 다. 정식 제목은 Sample, Simulate, Select: Physics-in-the-Loop Text-to-Motion for Humanoids Without Training 이고, University of Bonn 에서 낸 논문이다. 논문은 이 방법을 줄여서 S3 라고 부른다. 문장으로 휴머노이드 동작을 만들 때, 아무것도 학습하지 않고 어디까지 갈 수 있는지를 잰다.논문은 두 갈래의 기술에서 출발한다. 하나는 text-to-motion 이다. HumanML3D 를 기준으로 diffusion 모델에서 token 생성기로 옮겨 오며 사람 몸(SMPL)의 동작을 문장으로 만들어 낸다. 다른 하나는 강화학습으로 만든 휴머노이드 whole..

논문 리뷰 2026.10.08

# [군집 휴머노이드 연구일지 #68] IGRIS-C 8클립 완주율, 그리고 새 주제: 과제를 연달아 할 때 왜 실패하나

## 오늘의 작업motion tracking은 IGRIS-C에서 클립별 학습 결과를 이어서 봤다. 걷기 7개는 95~100%가 나왔고, 댄스(dance2)는 0%다.새로 시작한 주제도 있다. 로봇이 과제를 여러 개 연달아 할 때 왜 실패하는지 정확히 재고, 그 원인에 맞는 해결책을 찾는 long-horizon-handoff다. CALVIN에서 먼저 재고 있고, LIBERO로 넓힐 예정이다. GitHub - hooneyskywalker0127/humanoid-motion-tracking: Human mocap retargeting and whole-body motion tracking for humanoids (UniHuman mocap retargeting and whole-body motion trac..

로보틱스 & AI 2026.10.08

[논문 리뷰 #77] ActionCodec, VLA 가 배우기 쉬운 action tokenizer 의 조건을 정리한 논문을 읽고

이번에 읽은 논문은 ActionCodec 이다. 정식 제목은 ActionCodec: What Makes for Good Action Tokenizers 이고, Knowin AI, Tsinghua University, Tianjin University, Fudan University, Shanghai Innovation Institute 가 함께 낸 2026 년 논문이다. 제목이 질문 그대로다. 좋은 action tokenizer 란 무엇인가.배경부터 정리한다. VLA 는 VLM 을 대규모 로봇 데이터로 fine-tuning 해서, 영상과 언어 지시로부터 로봇 action 을 내는 모델이다. 논문은 최근의 VLA 가 VLM 에서 출발하면서도 별도의 action head 나 diffusion 기반 exper..

논문 리뷰 2026.10.07

[논문 리뷰 #76] OAT, 로봇 행동을 순서 있는 토큰으로 바꾸는 action tokenizer 를 읽고

이번에 읽은 논문은 OAT 다. 정식 제목은 OAT: Ordered Action Tokenization 이고, Harvard University 와 Stanford University 에서 낸 2026 년 논문이다. 로봇의 연속적인 행동을 autoregressive policy 가 다룰 수 있는 토큰으로 바꾸는 방법, 즉 action tokenization 을 다룬다.논문은 autoregressive sequence model 이 현대 로봇 학습의 강력한 기반이 되었다는 데서 시작한다. 로봇 데이터로 직접 학습하든 사전학습된 vision-language backbone 에서 출발하든, 큰 transformer 기반 policy 들이 강한 일반화를 보였다. 그런데 이 성공 밑에는 자주 따져지지 않는 요소가..

논문 리뷰 2026.10.06

# [군집 휴머노이드 연구일지 #67] IGRIS-C, 걷기는 100%인데 댄스는 0%

## 오늘의 작업motion tracking은 IGRIS-C에서 클립별 학습을 이어 가고 있다. 단순 걷기는 문제없다. 걷기 시퀀스 2개가 완주율 100%다. 그런데 댄스는 0%다.학습 중인 방식(BeyondMimic)도 간단히 정리했다.https://github.com/hooneyskywalker0127/humanoid-motion-tracking## 걷기 시퀀스 2개: 완주율 100%walk1_sub1walk1_sub2## 댄스 0%run, jump, dance는 완주하지 못할 거라고 예상했고, 댄스는 0%가 나왔다.원인은 1. 리타게팅을 잘못한걸까. G1과 달리 IGRIS-C는 GMR 리스트에 없다.2. IGRIS-C 자체가 저 동작들에 어려움을 겪나?그렇다기엔 풍차 돌리기도 한다.우선 전체 학습을..

로보틱스 & AI 2026.10.06

[논문 리뷰 #75] BEAST, 로봇 행동 궤적을 B-spline 제어점으로 토큰화하는 방법을 읽고

이번에 읽은 논문은 BEAST 다. 정식 제목은 BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning 이고, Karlsruhe Institute of Technology 와 Microsoft Research 가 낸 NeurIPS 2025 논문이다. 로봇의 연속적인 action 을 token 으로 바꾸는 action tokenizer 를 다룬다.논문의 출발점은 모방학습의 흐름이다. 초기 연구는 현재 관측으로 한 step 의 action 을 예측했는데, 최근에 action sequence 를 함께 학습하는 것이 사람 시연의 시간적 일관성을 잡고 오차 누적을 줄인다는 점이 강조되었다. 그리고 자연어 ..

논문 리뷰 2026.10.05

[논문 리뷰 #74] FAST, 로봇 행동을 압축해서 token 으로 만드는 action tokenization 을 읽고

이번에 읽은 논문은 FAST 다. 정식 제목은 FAST: Efficient Action Tokenization for Vision-Language-Action Models 이고, Physical Intelligence 와 UC Berkeley, Stanford 가 2025 년에 낸 논문이다. autoregressive VLA 가 로봇 행동을 어떤 token 으로 바꿔 배워야 하는지를 다룬다.Transformer 기반 VLA 는 이미지와 언어 지시를 받아 로봇 행동을 낸다. 그중 가장 흔한 설계는 언어 모델처럼 다음 token 을 하나씩 예측하는 autoregressive 방식인데, 이 방식은 연속적인 로봇 행동을 이산 token 으로 바꾸는 규칙, 즉 tokenization 을 정해야 한다. 논문은 언어..

논문 리뷰 2026.10.04

[논문 리뷰 #73] TEXEDO, 여러 개 만들고 로봇이 해낼 수 있는 것만 고르는 humanoid motion 생성을 읽고

말로 humanoid 를 움직이는 일은 보통 두 단계로 나뉜다. 문장을 받아 whole-body reference motion 을 만드는 단계와, 그 reference 를 실제 로봇 위에서 따라가는 단계다. 앞쪽은 text-conditioned motion generator 가, 뒤쪽은 whole-body tracking controller 가 맡는다. TEXEDO 는 이 두 단계 사이에 들어가는 방법이다. UC Berkeley, Nanjing University, Southern University of Science and Technology 가 함께 낸 논문이고, 실험 로봇은 Unitree G1, controller 는 SONIC 이다.논문은 최근의 흐름을 한 deployment pipeline 의..

논문 리뷰 2026.10.03

[논문 리뷰 #72] Any2Any, 한 휴머노이드에서 배운 전신 제어를 다른 휴머노이드로 옮기는 방법을 읽고

이번에 읽은 논문은 Any2Any 다. 정식 제목은 Any2Any: Efficient Cross-Embodiment Transfer for Humanoid Whole-Body Tracking 이고, LimX Dynamics 에서 낸 2026 년 논문이다. 한 로봇에서 학습한 whole-body tracking 정책을 다른 휴머노이드로 옮기는 문제를 다룬다.먼저 whole-body tracking, 줄여서 WBT 가 무엇인지부터 정리한다. 사람의 전신 동작을 reference 로 주면, 로봇이 다리와 몸통, 팔, 머리를 함께 움직이고 균형을 유지하면서 그 동작을 따라 하도록 학습한 정책이다. 논문은 WBT 를 behavior foundation model 형태의 control interface 로 보고, ..

논문 리뷰 2026.10.02