Playing Atari with Deep Reinforcement Learning Week -2

강화 학습의 기초부터 시작하기 위해 논문이 변경됨.

Abstract : 고차원 감각입력으로 직접 제어 정책을 학습하는 최초의 딥러닝 모델을 소개한다. 원시 픽셀을 입력받고 미래 보상을 추정하는 가치 함수를 출력한다. 아키텍처나 학습 알고리즘 조정 없이 아케이드 학습 환경의 아타리 게임에 적용했다. 그 결과, 이 모델은 6개의 게임에서 이전의 모든 접근 방식을 능가했으며, 3개의 게임에서는 인간 전문가를 능가했다.

Conclusion : 이 논문은 강화 학습을 위한 새로운 딥러닝 모델을 소개하고, 아타리 2600 컴퓨터 게임에서 어려운 제어 정책을 오직 원시 픽셀 입력만으로 마스터하는 능력을 입증했다. 또한 딥 네트워크의 강화 학습 훈련을 용이하게 하기 위해 확률적 미니배치 업데이트와 경험 재생 메모리를 결합한 온라인 Q-러닝의 변형을 제시했다. 우리의 접근 방식은 실험한 7개의 게임 중 6개에서 최첨단 결과를 제공했으며, 아키텍처나 하이퍼파라미터를 조정하지 않았다.

  • 모르는 용어, 개념, 질문

직접 제어 정책 : 강화 학습에서 에이전트가 현재 상태에서 어떤 행동을 취해야 할지 결정하는 함수. 즉, 강화 학습에서 "제어 정책"은 에이전트가 어떤 상태에서 어떤 행동을 취할지 결정하는 전략을 의미하고, "직접"이라는 말은 이 정책이 실제 행동으로 바로 이어진다는 점을 강조한다.

원시 픽셀 : 개별 픽셀의 색상 정보. 가공되지 않은 그대로의 픽셀 데이터.

아키텍처나 학습 알고리즘을 조정하지 않은 이유 : 모델의 일반화 능력을 강조하기 위함.

딥 네트워크 : 다층 신경망, 입력층과 출력층, 은닉층으로 구성.

확률적 Minibatch 업데이트 : 딥러닝에서는 일반적으로 전체 데이터를 한번에 학습시키는 대신 미니배치라고 불리는 부분집합을 사용해 모델을 학습시킴. 확률적 미니배치 업데이트는, Q-러닝에서 매번 얻는 경험을 하나씩 업데이트하는 대신, 경험을 모아서 작은 배치 단위로 랜덤하게 선택하여 학습하는 방식. 이를 통해 학습의 안정성을 높이고, 모델이 더 빠르게 수렴할 수 있도록 도움.

경험 재생 메모리 : 강화학습에서 에이전트가 얻은 과거의 경험들을 저장해두는 메모리. 이 메모리에서 이전 경험을 샘플링하여 학습에 재사용할 수 있음. Q 러닝에서는 새로운 경험 뿐 아니라 과거의 겪은 경험도 다시 학습함으로써 더 효율적인 학습을 도움.

온라인 Q 러닝 : 강화학습에서 사용되는 가치 기반 학습 알고리즘으로 에이전트가 환경과 상호작용하며 최적의 행동정책을 학습하는 방법. 학습이 되는 동안 즉시 Q값을 업데이트 함.

Q 값 : 강화학습에서 행동 가치함수를 나타내는 값

행동 가치 함수 : 강화학습에서 특정 상태에서 특정 행동을 취했을 때의 기대보상을 평가하는 함수.

0개의 댓글