BackGround 모르는 단어 정리
마르코프 결정 과정(MDP) : 의사결정 문제를 수학적으로 모델링 하는 방식 중 하나. 에이전트가 환경과 상호작용하면서 최적의 행동을 선택해 최대 보상을 얻는 문제를 해결하는 데 사용. 구성요소 1. 상태 집합 2. 행동 집합 3. 전이 확률 4. 보상함수
상태집합 S : 에이전트가 환경에서 취할수 있는 모든 가능한 상태의 집합. 각 상태는 현재 환경의 상황을 나타냄. 예를 들어, 게임의 경우 현재 캐릭터의 위치, 체력, 적의 위치 등이 상태에 해당할 수 있음.
행동집합 A : 에이전트가 각 상태에서 선택할 수 있는 모든 가능한 행동의 집합. 각 행동은 에이전트가 상태를 변화시키는 결정. 예를 들어, 게임에서는 앞으로 걷기, 점프하기, 공격하기 등이 행동이 될 수 있음.
전이확률 P : 에이전트가 특정 상태에서 특정 행동을 취했을 때, 다음 상태로 전이될 확률. 이 확률은 행동에 따른 상태의 변화를 확률적으로 모델링함으로는 P(s′∣s,a)로 표현되며, 이는 상태 s에서 행동 a를 취했을 때 상태 s′로 전이될 확률을 의미함. 총합은 1.
보상함수 R : 에이전트가 상태 s에서 행동 a를 취했을 때 얻는 보상. 일반적으로 에이전트가 취한 행동의 유용성을 측정하는 기준이 됨. 보상은 숫자로 표시.
마르코프 속성 : 현재 상태가 미래의 상태에 대한 모든 정보를 포함하고 있다는 것을 의미. . 즉, 과거의 상태와 행동은 현재 상태가 주어졌을 때 미래 상태에 영향을 미치지 않음.
미래 할인 보상 : 에이전트가 미래에 얻게 될 보상을 현재 시점에서 얼마나 중요한 것으로 여길지를 결정하는 개념.
벨만 방정식 : 최적성의 원리에 기반. 즉 최적의 원리를 따르는 한, 현재의 최적 결정은 미래의 최적 결정에 영향을 미친다는 것을 의미. 즉 현재의 최적 = 전체적으로 최적의 누적 보상 GET.
현재 상태의 가치는 해당 상태에서 선택할 수 있는 모든 행동 중 최적의 행동을 선택했을 때의 기대 보상으로 표현됨.