3D 환경에서 연속적인 인간의 행동을 시뮬레이션 하는데 있어서 언어는 사람의 명확한 목적과 의도를 잘 표현하고 전달하는 강력한 도구이다. 기존의 HSI연구들은 정적이거나 작은 객체만을 다루거나 일어나기, 의자에 앉기 등 한정적인 동작만 다루고 다양한 객체를 조작하는 능력은 부족하다. 최근 크고 다양한 물체를 조작하는 연구도 진행하고 있지만 입력으로 완성된 시퀀스의 객체 모션이나 과거 상호작용 상태의 시퀀스 입력을 필요로 한다. 따라서 저자들은 이러한 문제점을 인식하고 오직 인간과 객체의 초기상태와 언어 명령만으로 3D scene에서 다양한 객체에 대한 현실적인 인간-객체 상호작용을 생성하고자 한다.
그러나 이에는 2가지 어려움이 존재하는데
1. 객체와 인간 모두 동시에 현실적으로 동작하는 모션을 만들어야한다. 즉 생성된 모션은 객체가 움직일 때 항상 손에 접촉하고 있어야 하며 객체가 움직일 때는 인간의 행동과 관게가 있어야 한다.
2. 3D 장면을 기반으로 장애물이 존재하는 복잡한 환경을 고려하여 인간의 움직임을 즉 동작 경로를 생성해야 한다.
이를 위해 저자들은 객체의 희소한 웨이포인트를 사용하는데 이는 초기에 3D scene으로부터 추출한다. 그 다음 텍스트 형태의 지시사항과 초기 인간과 객체의 상태정보를 입력으로 이 웨이포인트 조건에 만족하는 motion(human, object둘 다)을 conditional diffusion model로 생성한다. 이 과정에서 생성되는 모션의 정확도를 개선하기 위해 object geometry loss를 포함하고 아예 명시적으로 접촉 제약을 강제하기 위해 guidance terms를 포함하여 생성되는 모션의 현실감을 높인다.