직접 제어 정책 : 강화 학습에서 에이전트가 현재 상태에서 어떤 행동을 취해야 할지 결정하는 함수. 즉, 강화 학습에서 "제어 정책"은 에이전트가 어떤 상태에서 어떤 행동을 취할지 결정하는 전략을 의미하고, "직접"이라는 말은 이 정책이 실제 행동으로 바로 이어진다는 점을 강조한다.
원시 픽셀 : 개별 픽셀의 색상 정보. 가공되지 않은 그대로의 픽셀 데이터.
아키텍처나 학습 알고리즘을 조정하지 않은 이유 : 모델의 일반화 능력을 강조하기 위함.
딥 네트워크 : 다층 신경망, 입력층과 출력층, 은닉층으로 구성.
확률적 Minibatch 업데이트 : 딥러닝에서는 일반적으로 전체 데이터를 한번에 학습시키는 대신 미니배치라고 불리는 부분집합을 사용해 모델을 학습시킴. 확률적 미니배치 업데이트는, Q-러닝에서 매번 얻는 경험을 하나씩 업데이트하는 대신, 경험을 모아서 작은 배치 단위로 랜덤하게 선택하여 학습하는 방식. 이를 통해 학습의 안정성을 높이고, 모델이 더 빠르게 수렴할 수 있도록 도움.
경험 재생 메모리 : 강화학습에서 에이전트가 얻은 과거의 경험들을 저장해두는 메모리. 이 메모리에서 이전 경험을 샘플링하여 학습에 재사용할 수 있음. Q 러닝에서는 새로운 경험 뿐 아니라 과거의 겪은 경험도 다시 학습함으로써 더 효율적인 학습을 도움.
온라인 Q 러닝 : 강화학습에서 사용되는 가치 기반 학습 알고리즘으로 에이전트가 환경과 상호작용하며 최적의 행동정책을 학습하는 방법. 학습이 되는 동안 즉시 Q값을 업데이트 함.
Q 값 : 강화학습에서 행동 가치함수를 나타내는 값
행동 가치 함수 : 강화학습에서 특정 상태에서 특정 행동을 취했을 때의 기대보상을 평가하는 함수.