이번에 읽은 논문은 Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition 이다. SimpleAI 에서 낸 논문이다. 제목이 길지만 다루는 질문은 하나다. 각각 잘 학습된 VLA skill 을 agent 가 차례로 불러 긴 가사 작업을 시킬 때, 왜 작업 전체는 거의 성공하지 못하는가. 논문은 이 질문에 성능을 올리는 방법이 아니라 실패를 나눠 보는 방법으로 답한다. 논문 스스로 BEHAVIOR-1K 에서 state-of-the-art task 성공을 주장하려는 것이 아니라고 밝히고, long-horizon rollout 이 실패할 때 agent harness 가 무엇을 드러낼 수 ..