Playing Atari with Deep Reinforcement Learning Week - 2.1

논문 Introduce 모르는 단어 정리

  • 감독 학습 : 데이터에 대해 입력과 출력이 주어진 상태에서 학습하는 방식. 즉 감독학습은 정답이 있는 데이터를 사용하여 학습하고, 비감독 학습은 정답이 없는 데이터를 분석하여 패턴을 찾음.

  • 스칼라 보상 신호 : 강화학습에서 에이전트가 특정 행동을 취한 후 환경으로부터 받는 보상. 이 보상은 행동의 결과가 얼마나 좋거나 나쁜지를 평가하는 스칼라 값으로 제공.

  • 타임스텝 : 에이전트가 환경과 상호작용하는 단위 시간.

  • 컨볼루션 신경망(Convolutional Neural Network, CNN) : 이미지나 영상과 같은 고차원 데이터를 처리하는 데 주로 사용되는 딥러닝 모델. 인간의 시신경을 모방하여 만든 딥러닝 구조. convolution 연산을 이용하여 이미지의 공간적인 정보를 유지.

  • Convolution 연산 : 이미지와 커널간의 곱셈 및 합산을 통해 특징을 추출하는 과정. 이미지의 특정 부분과 커널을 곱한 뒤 그 값을 합산하여 새로운 픽셀 값을 계산. 이미지 전체에 대해 과정을 반복함. 이를 통해 특징 맵(feature map)이 생성됨.

  • 커널 : 작은 크기의 행렬. 이미지의 특정한 특징, 예를들어 edge 등을 감지하는 역할을 함. CNN에서 커널은 주로 학습을 통해 정의되며, 학습과정에서 오차 역전파 알고리즘을 사용하여 최적화 됨. 이후 오차를 줄이기 위해 경사 하강법을 사용하여 커널 값을 조금씩 업데이트 함. 예를 들어, CNN이 사람 얼굴을 인식하는 문제를 학습하고 있다면, 초기에는 랜덤한 커널 값이 설정되지만 학습이 진행되면서 얼굴의 edge(눈, 코, 입 등의 경계)나 패턴을 감지하는 커널로 변환됨.

  • 오차 역전파 알고리즘 : 딥러닝 모델의 성능을 최적화하기 위해 각 가중치의 기울기를 계산하여 네트워크의 파라미터를 업데이트하는 데 중요한 도구. 가중치의 개별 연산을 전부 각각의 함수로 취급하면, 합성함수의 미분법을 사용하여 복잡했던 미분 계산을 간단하게 표현가능.

  • 경사하강법 : 함수의 값이 낮아지는 방향으로 각 독립변수들의 값을 변형시키면서 함수가 최솟값을 갖도록 하는 독립변수의 값을 탐색하는 방법을 의미

  • Q - 러닝 알고리즘 : 따로 정리하고 링크 달기

  • 경험 재생 메커니즘 : 강화 학습에서 에이전트가 학습을 안정화하고 효율적으로 하기 위해 사용하는 기법. 과거의 경험을 재활용하여 학습 성능을 향상.

0개의 댓글