Playing Atari with Deep Reinforcement Learning Week - 2.4

  1. Deep reinforcement learning 모르는 단어 정리
  • 터미널 : 에피소드가 끝나는 시점
  • On-policy : 에이전트가 학습하는 정책과 실제로 환경에서 행동하는 정책이 동일한 경우를 나타내는 용어.
  • 다운샘플링 : 데이터나 신호의 해상도를 줄이거나 샘플링 빈도를 낮추는 과정.
  • Forward pass : 신경망의 학습과 추론 과정에서 사용하는 기본적인 단계로, 주어진 입력 데이터에 대해 신경망을 통해 출력을 계산하는 과정.
  • Rectifier 비선형성 : 비선형 활성화 함수로 사용되는 ReLU(Rectified Linear Unit) 함수와 관련된 개념.
  • ReLU : 입력 값이 0보다 크면 그 값을 그대로 출력하고, 0 이하이면 0을 출력하는 활성화 함수.
  • Rectifier 유닛 : 주로 신경망에서 사용되는 ReLU (Rectified Linear Unit) 활성화 함수를 기반으로 하는 뉴런 유닛.

0개의 댓글