3.1.강화학습 기본 알고리즘-마르코프 결정과정
2
投稿した質問数 3
안녕하세요 좋은강의 잘듣고있습니다!
MDP 기본개념설명해주신 부분 중 3.1에서 교재 8페이지에 MDP를 계산하는 과정에서 정책1과 상태전이메트릭스1을 곱하고, 정책2도 상태전이메트릭스1에 곱한다고 나와있는데 이 부분이 잘 이해되지 않아 질문합니다. 정책이라는 것이 행동을 할 확률을 나타내는 것이므로 정책2도 상태전이메트릭스2에 곱하는게 맞는것이 아닌가라고 생각하였기에 이 부분이 궁금합니다

!
回答 1
0
안녕하세요, 인프런 AI 인턴입니다. 호기님.
질문하신 내용은 정책별로 상태전이확률을 구분해야 하는지에 대한 부분입니다.
일반적으로 MDP에서 정책을 고려한 상태전이확률은 다음과 같이 계산합니다.
[
P^\pi(s’|s)=\sum_a \pi(a|s)P(s’|s,a)
]
즉, 각 행동을 선택할 확률인 정책 (\pi(a|s))과 해당 행동을 했을 때의 상태전이확률 (P(s’|s,a))을 곱한 뒤 모두 더합니다.
따라서 행동 1과 행동 2에 따른 상태전이확률이 서로 다르다면 다음처럼 계산하는 것이 맞습니다.
[
\pi_1 \times p_1 + \pi_2 \times p_2
]
다만 교재의 예시에서는 정책 1과 정책 2를 선택하더라도 목표 상태로 이동할 상태전이확률이 동일하게 (p_1=0.7)이라고 가정했기 때문에 다음처럼 표현된 것입니다.
[
\pi_1 \times p_1+\pi_2 \times p_1
=0.4\times0.7+0.6\times0.7
=0.7
]
즉, 정책 2에 반드시 상태전이행렬 2를 곱하지 않는다는 의미가 아니라, 해당 예시에서는 두 정책을 선택했을 때의 특정 상태로 이동할 확률이 동일했기 때문에 같은 (p_1)을 사용한 것입니다. 행동 2를 선택했을 때의 상태전이확률이 (p_2)라면 호기님께서 생각하신 것처럼 (\pi_2 \times p_2)로 계산해야 합니다.

관련하여 정책과 상태전이확률을 함께 고려하는 예시는 아래 기존 답변에서도 확인하실 수 있습니다.
해당 답변에서도 정책 확률과 상태전이확률을 각각 곱한 뒤 합산하여, 정책을 반영한 최종 상태전이확률을 계산하는 과정을 설명하고 있습니다.
저는 질문자님의 이해를 돕고자 지식공유자님의 기존 답변을 참고하여 유사한 답변 링크를 추천해드리고 있습니다.
현재 베타 기능으로 답변이 만족스럽지 않을 수 있는 점 양해 부탁드립니다. 🙏
추가적으로 궁금한 점이 있으시면, 이어서 질문해 주세요. 곧 지식공유자께서 답변해 주실 것입니다.
매수 실행 시점 관련
0
7
0
영상 다운로드는 안되나요?
0
13
0
수강자료 다운로드 관련 문의
0
21
2
Opus/Sonnet 버전 관련 문의
1
21
2
"run_nvidia_gpu.bat" 실행후
0
15
1
섹션2 질문이요
1
21
2
섹션 2
0
17
1
섹션1.9 질문입니다!
1
34
3
웹서비스 방법
0
34
2
MCP 정의가 잘못되어 있음 (Chapter2)
0
31
1
수강 연장 문의드립니다.
0
33
2
13. (App 2) 기본기 훈련 에서
0
34
1
채점 프로그램 미작동
0
28
2
챌린지 시작일 문의
0
39
0
2. 어떤 도구를 사용하는 것이 가장 유리할까? 강의 중
0
32
1
안녕하세요 ppt 자료 메일로 부탁드립니다
0
24
1
11차시 Antigravity IDE 설치 후
0
34
1
링크드 리스트 중간 삽입삭제 시간복잡도 질문
0
37
2
마르코프 결정과정 질문
0
123
2
stable_baseline3 설치 안됨
0
423
2
자산배분비율 변경 백테스트와 어떻게 다르죠?
0
160
2
소스코드 없어요
0
154
2
강화학습, 머신러닝에 관심 있는 웹 개발자입니다. 수학적 난이도 때문에 실무 활용이 고민됩니다.
0
243
1
실습 프로그램 파일 제공 문의
0
117
1

