[Learning Agile, Vision-based Drone Flight: from Simulation to Reality] ([2304.04128] Learning Agile, Vision-based Drone Flight: from Simulation to Reality) (Davide Scaramuzza, Elia Kaufmann / ISRR, 2022)
https://www.youtube.com/watch?v=giridPDPAB0
Notes
- RPG-UZH 교수님이 직접 쓰신 짧은 abstract paper.
→ 위에 첨부한 스피치 영상을 보는게 재밌긴 함- Agile, vision-based quadrotor flight를 위한 deep sensorimotor policy 방법론에 대해 간단 소개
- 그리고 sim2real 문제 해결하기 위한 방법들 소개 → 이전 여러 연구들로 설명
Current robots are far from human performance in agility, versatility, robustness.
→ Agile autonomous drone은 아직 unsolved.

일단 모듈이 많아질수록 perception → action까지 딜레이가 증가하며, 앞 모듈의 작은 error들이 뒤로 갈수록 누적되므로 전체 시스템이 효율적이지 못하다.
추가적으로 이러한 방법론들은 PID나 MPC control에 의존하는데, 이는 튜닝이 매우 어렵고, 복잡한 dynamics에 대처하기가 매우 어렵다.

End-to-End sensorimotor policy learning이다.➡️ 이러한 문제를 어떻게 해결할 수 있을지 한번 알아보자.
Domain randomization 적용
Sensor observation의 abstraction 활용
특히, 이러한 문제들을 address할 수 있는 몇 가지 task를 선정하여 연구
https://www.youtube.com/watch?v=m89bNn6RFoQ
[Learning High-Speed Flight in the Wild] ([2110.05113] Learning High-Speed Flight in the Wild(Antonio Loquercio, Elia Kaufmann, René Ranftl, Matthias Müller, Vladlen Koltun, Davide Scaramuzza / Sci. Robot. , 2021)
해당 연구에서는 자연 환경에서 온보드 센서와 컴퓨팅만으로 10m/s정도의 고속 자율 주행이 가능했다.
핵심 아이디어는 noisy sensory observation을 직접 collision-free trajectory로 mapping한 것
→ 실시간으로 sensor값을 보고 local trajectory를 바로 출력하도록 CNN을 학습
→ map search & building / safe corridor 계산 / optimization 등 없음.
→ processing latency가 줄고, noisy & incomplete perception에 robust함.

Privileged learning을 활용해서 시뮬레이션에서 학습함depth abstraction을 활용➡️ dense forest, snow-covered terrain, collapsed building 등 다양한 실 세계 환경에서 zero-shot transfer 성공
⭐ 즉, Planning을 NN으로 대체하는 연구
https://www.youtube.com/watch?v=2N_wKXQ6MXA
[Deep Drone Acrobatics] ([2006.05768] Deep Drone Acrobatics (Elia Kaufmann, Antonio Loquercio, René Ranftl, Matthias Müller, Vladlen Koltun, Davide Scaramuzza / RSS , 2020)

이번에도 마찬가지로 시뮬레이션에서 정확한 state 정보를 알고 있는 expert controller를 imitate하도록 학습.
100% simulation에서 학습하였으며, domain gap 줄이기 위해서 여기서도 sensor abstraction 사용
⭐ 즉, Control을 NN으로 대체하는 연구
Drone Racing에 필요한 sensorimotor skill은 실제 산업/안전 분야에 적극적 활용 가능 → 복잡하고 좁은 구조물에서 빠르게 이동
인간 조종사와 직접적으로 비교가 가능한 객관적인 test bed
➡️ 이러한 이유로 Drone racing은 자율비행드론 분야에서 연구가치가 높은 task
[Time-Optimal Planning for Quadrotor Waypoint Flight] ([2108.04537] Time-Optimal Planning for Quadrotor Waypoint Flight (Philipp Foehn, Angel Romero, Davide Scaramuzza / Sci. Robots. 2021)
→ 그래서 globally consistent state estimate를 쓰는 대신에 NN으로 waypoint를 예측하도록 방법을 활용
→ 그래서 이 다음 waypoint를 어떻게 표현할지가 중요해짐.
[Deep Drone Racing: Learning Agile Flight in Dynamic Environments] ([1806.08548] Deep Drone Racing: Learning Agile Flight in Dynamic Environments (Elia Kaufmann, Antonio Loquercio, Rene Ranftl, Alexey Dosovitskiy, Vladlen Koltun, Davide Scaramuzza / CORL, 2018)

Position 주어졌을 때, prediction horizon만큼 떨어진 global reference trajectory 위의 를 계산
를 image plane에 projection해서 이미지 상의 goal direction 계산
Desired velocity는 에서 global reference traj까지 가장 가까운 점 에서의 속도.
→ 이렇게 GT goal direction과 desired speed를 만듬
⭐ 즉, Perception을 NN으로 대체하는 연구
[Beauty and the Beast: Optimal Methods Meet Learning for Drone Racing] ([1810.06224] Beauty and the Beast: Optimal Methods Meet Learning for Drone Racing (Elia Kaufmann, Mathias Gehrig, Philipp Foehn, René Ranftl, Alexey Dosovitskiy, Vladlen Koltun, Davide Scaramuzza / ICRA, 2019)
[Deep Drone Racing: From Simulation to Reality with Domain Randomization] ([1905.09727] Deep Drone Racing: From Simulation to Reality with Domain Randomization (Antonio Loquercio, Elia Kaufmann, René Ranftl, Alexey Dosovitskiy, Vladlen Koltun, Davide Scaramuzza / IEEE T-RO, 2019)
https://www.youtube.com/watch?v=DGjwm5PZQT8

→ NN이 appearance보다 geometry에 집중하도록.
[AlphaPilot: Autonomous Drone Racing] ([2005.12813] AlphaPilot: Autonomous Drone Racing (Philipp Foehn, Dario Brescianini, Elia Kaufmann, Titus Cieslewski, Mathias Gehrig, Manasi Muglikar, Davide Scaramuzza / RSS, 2021)

Perception
State Estimation
Planning and Control
이러한 연구들을 쭉 살펴보면, 아직 자율비행이 인간의 수준에는 멀었음.
앞으로 아래와 같은 부분에 대해 더 많은 발전이 필요함
Generalization
현재 대부분 연구들은 모두 특정 task에 최적화된 전용 정책
새로운 task에 적용하려면 새로 학습을 해야함.
→ hierarchical learning
Latent space policies for hierarchical reinforcement learning (PMLR, 2018)
→ Optimize policy parameters on a learned manifold
Learning agile robotic locomotion skills by imitating animals (RSS, 2020)
Continual Learning현재 대부분 연구들은 학습이 끝난 후에는 실제 적용될 때 네트워크가 static.
하지만 실제 환경에서 계쏙해서 학습해나갈 수 있는 에이전트가 있다면 훨씬 더 좋을 것
→ adaptive laerning, meta learning …