Title : π 0.7 : Act, Sense, Act: Learning Non-Markovian Active Perception Strategies from Large-Scale Egocentric Human Data (ArXiv 2026)
논문 링크 : https://arxiv.org/pdf/2602.04600
blog: https://jern-li.github.io/asa/

1. Introduction
- Background
- 최근 로봇 Manipulation 분야는 Imitation Learning(IL)과 Foundation Model(VLA 등)의 발전으로 큰 성과를 거둠
- 하지만 기존 방식은 구조화된 환경의 고정된(stationary)데이터에 의존하며, 환경이 바뀌거나 정보가 부족한 상황에서는 반응적인 움직임에 그치는 한계가 있음.
- 핵심 문제: Perceptual Passivity(지각적 수용성)
- 복잡하고 비구조화된 환경에서 로봇이 성공하려면 단순히 움직이는 것을 넘어, 이전 상호작용 이력을 바탕으로 의도적인 응시(intentional gazing)와 탐색(exploration)을 수행해야 함
- 예: 도구함 깊숙이 파묻힌 렌치를 찾기 위해 주변 물체를 치우거나 시점(Viewpoint)을 변경하여 가려진 영역(occluded regions)을 확인해야 함.
- 해결책: Active Perception(능동적 지각)
- 지각과 행동이 긴밀하게 결합된 "Act, Sense, Act" 루프를 제안함.
- 지각을 통해 얻은 정보가 적응적 결정(adaptive decisions)을 내리게 하고, 이 결정이 다시 지각적 모호성을 해결하기 위해 행동을 가이드하는 closed-loop process
- 기존 연구의 한계
- 일부 연구에서는 시점 조절을 했으나, Active Perception 제어를 단순히 추가적인 행동 차원(extra action dimension)으로만 취급함.
- 대부분 머리 움직임(head movement)을 통한 시점 조정에만 국한되며, 신체 이동이나 물리적 조작(예: 서랍 열기)을 정보를 얻기 위한 전략적 도구로 활용하지 못함.
- Proposed: CoMe-VLA
- Active Perception을 정보 이득(information gain)과 의사 결정 분기(decision branching)에 의한 Non-Markovian Decision Process(NMDP)로 정형화함.
- CoMe-VLA 프레임워크 도입: 대규모 인간 Egocentric 데이터를 활용하여 탐색 및 조작에 대한 Prior를 학습함.
- Cognitive Auxiliary Head: 하위 작업(Sub-task)의 완료 및 전환을 감지함.
- Dual-track Memory System: 시각 및 고유 수용성 감각(proprioceptive)정보를 융합하여 시간적 맥락(temporal context)을 유지함.
- 인간-로봇의 hand-eye coordination을 통합된 Egocentric Action Space에서 정렬하여 3단계 점진적 학습을 수행함.

- Active Perception을 단순한 반응형 동작이 아닌, 정보 불확실성을 해소하기 위한 능동적인 루프로 정의함.
- 핵심 매커니즘: Non-Markovian Decision Preocess(NMDP)
- Active Perception을 다음 두 가지 메커니즘을 포함하는 NMDP로 모델링함.
- Information Gain(정보 이득): 행동(At)을 통해 미래의 관측(ot+1)에 대한 불확실성을 점진적으로 줄여나가는 과정임. 이를 수식적으로 상호 정보량(Mutual Information)을 통해 정형화함.
- I(ot+1;At∣ht,ot)
- Decision Branching(의사 결정 분기): 과거 맥락(ht)과 현재 관측(ot)에 따라 서로 다른 행동 시퀀스를 트리거하는 NMDP적 Mapping
- At=π(ht,ot)
- Decision Branching의 두 가지 형태
- Exploratory Branching(탐색적 분기): Perception 증거에 따라 탐색 전략을 조정함(예: 목표물을 찾으면 응시하고, 못 찾으면 Scanning)
- Exploitative Branching(활용적 분기): 해소된 지각 상태에 따라 조작 전략을 조정함(예: 물체가 왼쪽에 있으면 왼손으로 , 오른쪽에 있으면 오른손으로 잡음)
- Paradignms of Visual Activce Perception
- Information Discovery(ID, 정보 발견): 관련 정보가 처음에 없을 때 이를 시야로 가져오기 위한 전략
- Viewpoint Discovery(VD): head 회전이나 Base 이동을 통해 시점 변경
- Manipulation Discovery(MD): 서랍을 여는 등 환경과 물리적으로 상호작용하여 숨겨진 정보를 노출
- Information Enrichment(IE, 정보 풍부화): 정보는 존재하지만 정밀 작업이 부족할 때, 물체를 가까이 가져와 해상도를 높이는 등의 행동
- Passive vs Active Perception 비교
- Passive : 정적인 관측에 기반해 선형적으로 행동하며, 물체가 시야 밖(Out of View)에 있거나 Occlusion에 대응하지 못함
- Active: 정보 불확실성을 해결하기 위해 의도적인 행동을 실행하고, 그 결과에 따라 후속 행동의 branch가 결정됨
4. Data Collection

-
CoMe-VLA 학습을 위해 Large scale human data와 robot teleoporation data를 결합하여 사용
-
Large-Scale Egocentric Human Dataset
- 인간이 물리적 제약 하에서 수행하는 Perception, 의사결정, 실행 과정을 학습하기 위해 공개 데이터셋을 활용함
- 선택 기준: 세밀한 행동 및 상태 이해를 위한 Annotation, hand와 head pose 동기화. 가려짐이나 동적 상호작용이 포함된 Active Perception 시나리오 포함 여부
- 사용 데이터: CaptainCook4D(구조화된 요리 절차)와 Ego-Exo4D(다양하고 비구조화된 실제 환경)를 주요 소스로 선택
-
Egocentric Robot Teleoperation
- Human data의 Prior를 실제 로봇 embodiment와 환경에 grounding시키기 위해 데이터를 수집
- Hardware platform: 바퀴형 휴머노이드 Corenetic Monte02를 사용하며, 모바일 새시(2 DoF), 머리(2 DoF), 양팔(14DoF), 그리퍼(2 DoF)를 제어함.
- Immersivve Teleoperation System: Meta Quest 3 VR 헤드셋을 통해 로봇의 1인칭 Visual Stream만 보면서 조종
- Strict "Blind" Protocol: 조종자가 목표물의 위치를 미리 알지 못하게 하여, 실제 정보 탐색 행위(Information-seeking behavior)가 데이터에 담기도록 강제함.
-
Human-Robot Data Alignment
- Unified Action Space: 인간과 로봇의 서로 다른 신체 구조와 센서 결정을 극복하기 위해 통합된 1인칭 행동 공간을 정의함.
- 에피소드 상대 좌표계(Episode-relative Frame): 각 trajectory를 첫 번째 프레임을 기준(Base Frame)으로 설정하여 모든 Pose를 상대적으로 표현함으로써 데이터 분포 차이를 완화함.
- Pose 및 Gripper 정규화:
- Head(시점)와 양 손목의 Pose를 동일한 Local Frame으로 변환
- 인간의 손가락 움직임을 평균 거리 기반의 단일 그리퍼 너비(0~1 사이 값)로 매핑하여 로봇의 그리퍼와 일치시킴
- 로봇의 새시 이동과 머리 관절 움직임을 합쳐 인간의 머리 포즈와 대응되는 복합 head pose로 통합 관리
5. Model Design

6. Experiments

-
본 섹션에서는 CoMe-VLA의 성능을 검증하기 위해 5가지 주요 질문(장기 작업 수행 능력, 인간 데이터 Pretraining의 효과, 인지 및 메모리 시스템 기여도, 동적 환경에서의 강건성 등)에 답하는 실험을 진행함
-
Implementation Details
- Task 설정(5개 Tasks): Active Perception 패러다임에 따라 설계됨.
- Croissant Search(ID-VD): Head Scan을 통해 시야 밖에 있는 크로와상을 찾아 집어 올림
- Can Disposal(ID-VD): 캔 두개를 잡고 base를 이동하여 보이지 않는 쓰레기통을 찾아 버림
- Bottle Retrieval(ID-MD): 캐비닛을 열어 가려진 선반에서 병을 식별하고 꺼냄.
- Cylinder Hunt(ID-MD): 뒤집힌 두 개의 보울 중 하나에 숨겨진 실린더를 찾아 목표 지점에 놓음
- Ring Peg(IE): 멀리 있는 페그를 가까이 가져와 정밀하게 링을 끼움.
- 데이터 및 훈련: 800K의 인간 데이터(22.2시간)와 태스크당 100K의 로봇 데이터(0.9시간)로 학습하며, 8개의 NVIDIA H100 GPU에서 3일간 Train
-
Comparative Evaluation

- 비교 대상: OpenVLA-OFT, π0.5, 와 같은 VLA모델 및 ACT, Diffusion Policy(DP)와 같은 Task 전용 policy와 비교
- 주요 결과
- 성능 우위: CoMe-VLA는 평균 성공률(SR) 83.3%를 기록하며 모든 베이스라인(최대 16.7%)을 압도함
- 탐색 효율성: 평균 탐색 시간(ST) 97.9초를 기록하며 가장 효율적인 탐색 능력을 보여줌.
- 기존 모델의 한계: 베이스라인들은 "Random-walk"식의 무작위 행동을 보이거나, 특정 방향으로만 머리를 돌리는 Aciton Bias를 보임
-
데이터 구성 분석(Data Composition Analysis)
- 인간 데이터의 영향: 로봇 데이터만 사용할 때(42.7%)보다 400k 인간 데이터를 추가했을 때(72.0%) 성능이 급격히 향상됨.
- Scaling Trend: 인간 데이터를 800K로 늘리면 성공률이 87.3%까지 상승하며 선형적인 성능 향상을 보임
- 데이터 효율성: 대규모 인간 데이터가 뒷받침되면 로봇 데이터를 1/4로 줄여도 성능 하락이 미미(87.3 -> 83.3%)하여, 로봇 시연 데이터 수집의 어려움을 크게 완화해줌
-
Ablation Studies
-
인지 메커니즘(Cognition)
- 인지 기반 태스크 분할이 없으면 성공률이 급락함(22.7%)
- stage1(인지 사전 학습)을 생략할 경우 SR이 31.3% 감소하며, 고수준 추론과 저수준 제어 사이의 간섭을 막는 단계별 학습의 중요성을 증명함.

-
메모리 시스템(Memory)
- 메모리를 제거하면 성능이 40.7%로 반토막나며, Active Perception의 NMDP 특성을 확인시켜줌
- Dual-track 구조: visual 과 Proprioception을 분리해 모델링하는 것이 단일 결합 메모리보다 우수함.
- 메모리 길이: History frame을 5개 사용할 때가 3개나 1개보다 월등한 성능을 보임

-
강건성 분석(Robustness Analysis)
- 동적 환경 테스트: 타겟이 갑자기 사라지거나 위치가 바뀌는 상황에서도 로봇은 갇히지 않고 지속적으로 스캔을 수행함
- Visual Locking: 타겟이 다시 나타나면 즉시 시각적으로 고정(Locking)하고 응시를 유지하며, 다시 사라지면 즉각 탐색 모드로 복귀하는 유연한 전환 능력을 보여줌.
7. Limitations and Future work
- 메모리 설계의 한계
- 현재의 고정되고 짧은 시간 윈도우 방식은 수십 분 이상의 초장기 작업(Long-horizon tasks)에서 한계가 있으며, 단순히 길이를 늘릴 경우 오래된 정보가 간섭을 일으킬 수 있음
- 데이터 효율성 문제: 인간 데이터가 로봇 데이터의 복잡성을 줄여주긴 하지만, 특정 로봇 본체와 환경에 적응하기 위해 여전히 수동적인 teleoperation data가 필요함
- 향후 발전 방향'
- 비디오 스트리밍 입력 및 신념 인식(belief-aware) 메모리 표현 연구
- 강화학습을 결합하여 복잡하고 비구조화된 환경에서 능동 지각 전략을 자율적으로 탐색하는 방식을 도입