Playing Atari with Deep Reinforcement Learning Week - 2.5

  1. Experiments 모르는 단어 정리
  • 보상 클리핑 : 강화 학습에서 보상의 크기를 일정 범위로 제한하는 기법.
  • RMSProp 알고리즘(Root Mean Square Propagation) : 특히 학습률 조정을 통해 학습을 안정화시키고 수렴 속도를 개선하는 데 도움을 줌. 작동 원리 1. 적응형 학습률 2. 지수 가중 평균. 3. 학습률 조정
  • 적응형 학습률 : RMSProp은 각 매개변수의 업데이트를 조정하기 위해 그라디언트의 제곱 평균을 사용. 이로 인해 자주 업데이트되는 매개변수는 더 적은 학습률을 가지며, 덜 업데이트되는 매개변수는 상대적으로 큰 학습률을 갖게 됨.
  • 지수 가중 평균 : RMSProp은 그라디언트의 제곱 값을 지수 가중 평균으로 계산하여, 최근 그라디언트의 제곱에 더 많은 가중치를 부여.
  • 학습률 조정 : 매개변수 업데이트.
  • 진화 정책 검색 접근 방식 : 강화 학습에서 정책을 최적화하기 위해 진화 알고리즘을 사용하는 방법.

진화 알고리즘의 주요 개념

개체군(Population):
진화 알고리즘은 여러 개체(해)를 포함하는 개체군을 사용함. 각 개체는 문제의 가능한 해를 나타냄.
적합도 함수(Fitness Function):
각 개체의 성능을 평가하는 함수로, 개체가 얼마나 잘 문제를 해결하는지를 측정함. 적합도 값이 높을수록 더 좋은 해.
선택(Selection):
적합도가 높은 개체를 선택하여 다음 세대의 부모로 사용함. 이는 자연 선택의 원리를 반영하여 좋은 특성을 가진 개체가 다음 세대에 전달되도록 함.
교배(Crossover):
선택된 부모 개체의 유전자를 교환하여 새로운 개체를 생성. 교배는 부모의 특성을 조합하여 더 나은 자손을 만드는 과정.
변이(Mutation):
새로운 개체에 무작위로 작은 변화를 주어 다양한 해를 탐색할 수 있도록 함. 변이는 탐색 공간의 다각화를 도움.
적합도 평가(Fitness Evaluation):
생성된 개체는 적합도 함수를 사용하여 평가되며, 이 정보는 다음 세대의 생성 과정에 반영됨.

0개의 댓글