| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
- 정렬
- 샤논 엔트로피
- 아니메컵
- 27448
- python
- 구현
- ps
- C
- 딥러닝
- 정답코드
- populating next right pointers in each node
- 다이나믹 프로그래밍
- 백준
- 코딩테스트
- BFS
- lgb
- T tree
- 코테
- 파이썬
- 17070
- 실질적 약수
- 부분수열의 합2
- 코복장
- 2247
- dfs
- 모두의 꿈
- 힙 정렬
- 스펨메일 분류
- dp
- 코딩
- Today
- Total
목록전체 글 (160)
코딩복습장
이전의 value iteration (dynamic programming)을 통해 최적의 policy를 찾아갈 수 있음을 확인했다. 하지만 모든 상황에 대한 state, action, trasition을 모두 계산해야 하기 때문에 현실 세계에 적용하기에는 무리가 있다. $\Rightarrow$ 계산복잡도가 너무 높아지기 때문 사람은 새로운 지식을 배울 때, 모든 경우의 수를 전부 탐색하지 않는다. 우선 시도해보고 결과를 낸다음 피드벡을 통해 정보를 수집한다. 강화학습에 이러한 매커니즘을 적용한 것이 몬테카를로와 TD이다. Monte Carlo 몬테카를로 예측은 가치 함수를 추정할 때, 충분히 많이 수행한 후 평균을 계산하는 방법이다. i번째 시나리오에서, 어떤 state를 지난 후 return값..
이번엔 지난 시간에 공부했던 Bellman Equation을 Frozenlake환경에서 구현해보려고 한다. 환경은 grid world이다. gymnasium라이브러리의 FrozenLake-v1환경을 사용할 것이다. map의 크기는 4x4이다. 실습에 사용되는 코드는 3개의 함수로 구성되어 있다. value_iteration: bellman equation으로 state value function을 만드는 함수(최대 기대값을 주는 행동 가치로 map을 채움)extract_policy: value_itertation에서 구한 state value funciton을 가지고 최적의 policy를 추출하는 함수print_grid: policy를 시각화하는 함수 코드분석 env = gym.make('Froz..
MDP란 5가지 요소를 통해 순차적 의사결정 문제를 수학적으로 나타낸 것임을 이전의 글에서 알아보았다. 이렇게 MDP로 문제를 정의한 후, 결국 찾고자 하는 것은 최적의 policy를 찾는 것이다. policy란 어떤 action을 선택할 것인가 이다. grid world 예제로 살펴보자 원이 (0, 1) 위치에서 $A = {상, 하, 좌, 우}$ 어떤 행동을 선택하는 것이 최적의 policy일까?당연히 '하' 를 선택하도록 하는 policy가 최적의 policy일 것이다. 이처럼 policy는 특정 상황에서 어떤 action을 할 지 선택하는 것을 의미한다. 다만, 예시처럼 항상 하나의 action을 선택하는 것은 아니다. (0, 0) 에 파란 공이 위치할 경우 '우', '하'를 50%의 ..
MDP (Markov Decision Process)MDP란 순차적 행동 결정문제를 수학적으로 정의한 것이다. MDP로 정의되기 위해서는 Markov 속성이 성립해야 한다. Markov 가정에 대해 살펴보기 전에 MDP로 정의되는 문제의 구성요소를 살펴보자. MDP의 구성요소 StateAction RewardP (상태 변환 확률)Discount factor이 5가지가 MDP의 구성요소이다. Grid world를 통해 각 요소를 살펴보겠다. 이 그림은 파란 공을 이동시키며 별 위치에 도달하면 Reward를 받는 Grid world이다. State $S$ - 환경 속 가능한 상태의 집합상태는 개발자가 직접 정의한다. Grid world에서는 원의 현재위치를 State로 정의하고 이를 다음과 같이..