[Learning on the Fly: Rapid Policy Adaptation via Differentiable Simulation](Learning on the Fly: Rapid Policy Adaptation via Differentiable Simulation) (Jiahe Pan, Jiaxu Xing, Rudolf Reiter, Yifan Zhai, Elie Aljalbout, Davide Scaramuzza / RAL, 2025)
Visual feature based policy + differential simulation + sim2real fast adaptation (residual learning)
미리 모든 환경을 커버하려 하지 말고 상황에 맞게 즉석에서 fitting해서 쓰자

Policy Pretraining + Online Adaptation
Online Adaptation에서는 아래 세 루프를 동시에 돌림
1. Real world rollout
- 실제 드론 비행에서 trajectory 얻음
2. Residual Dynamic Learning
- 간단한 dynamic model이 맞추지 못한 가속도 residual 학습
→ 이건 supervised learning
- state, action 주어졌을 때 실제로 드론의 가속도와 계산되는 가속도를 비교
3. Policy Training
- Residual network가 주는 residual을 통해 dynamics가 정확해지고, 이를 기반으로 하는 differentiable simulator에서 policy 학습
➡️ 5초 정도면 adaptation이 끝난다고 함.
💡Low-fidelity vs. High-fidelity Dynamics model