[논문리뷰] CHOIS:Controllable Human-Object Interaction Synthesis(ECCV 2024 oral)

윤정윤·2025년 7월 23일

Introduction

3D 환경에서 연속적인 인간의 행동을 시뮬레이션 하는데 있어서 언어는 사람의 명확한 목적과 의도를 잘 표현하고 전달하는 강력한 도구이다. 기존의 HSI연구들은 정적이거나 작은 객체만을 다루거나 일어나기, 의자에 앉기 등 한정적인 동작만 다루고 다양한 객체를 조작하는 능력은 부족하다. 최근 크고 다양한 물체를 조작하는 연구도 진행하고 있지만 입력으로 완성된 시퀀스의 객체 모션이나 과거 상호작용 상태의 시퀀스 입력을 필요로 한다. 따라서 저자들은 이러한 문제점을 인식하고 오직 인간과 객체의 초기상태와 언어 명령만으로 3D scene에서 다양한 객체에 대한 현실적인 인간-객체 상호작용을 생성하고자 한다.

그러나 이에는 2가지 어려움이 존재하는데
1. 객체와 인간 모두 동시에 현실적으로 동작하는 모션을 만들어야한다. 즉 생성된 모션은 객체가 움직일 때 항상 손에 접촉하고 있어야 하며 객체가 움직일 때는 인간의 행동과 관게가 있어야 한다.
2. 3D 장면을 기반으로 장애물이 존재하는 복잡한 환경을 고려하여 인간의 움직임을 즉 동작 경로를 생성해야 한다.

이를 위해 저자들은 객체의 희소한 웨이포인트를 사용하는데 이는 초기에 3D scene으로부터 추출한다. 그 다음 텍스트 형태의 지시사항과 초기 인간과 객체의 상태정보를 입력으로 이 웨이포인트 조건에 만족하는 motion(human, object둘 다)을 conditional diffusion model로 생성한다. 이 과정에서 생성되는 모션의 정확도를 개선하기 위해 object geometry loss를 포함하고 아예 명시적으로 접촉 제약을 강제하기 위해 guidance terms를 포함하여 생성되는 모션의 현실감을 높인다.

Contribution

  1. 언어적 정보와 객체 웨이포인트의 조합이 인간 객체 상호작용 생성에 정밀하고 중요한 정보를 제공함을 입증하고 이 과정 중 객체 웨이포인트가 조밀하지 않아도 됨을 밝혀 기존 경로 계획 알고리즘을 활용하여 웨이포인트를 생성할 수 있음을 제안한다.
  2. 이러한 발견을 바탕으로 언어와 객체의 희소한 웨이포인트를 가이드로하여 conditional diffusion model을 사용해서 인간-객체 상호작용을 생성하는 방법을 고안한다.
  3. 이 방법이 fullbodymanipulate dataset에서 리얼한 상호작용을 생성할 수 있음을 입증하고 새로운 객체에도 일반화 될 수 있음을 보였고 3D 장면과 언어입력으로 부터 장기적이고 환경을 인지한 인간-객체 상호작용을 합성하는 파이프라인을 통합하였다.

Method

profile
AI꿈나무

0개의 댓글