3.1.강화학습 기본 알고리즘-마르코프 결정과정
9
작성한 질문수 3
안녕하세요 좋은강의 잘듣고있습니다!
MDP 기본개념설명해주신 부분 중 3.1에서 교재 8페이지에 MDP를 계산하는 과정에서 정책1과 상태전이메트릭스1을 곱하고, 정책2도 상태전이메트릭스1에 곱한다고 나와있는데 이 부분이 잘 이해되지 않아 질문합니다. 정책이라는 것이 행동을 할 확률을 나타내는 것이므로 정책2도 상태전이메트릭스2에 곱하는게 맞는것이 아닌가라고 생각하였기에 이 부분이 궁금합니다

!
답변 2
0
안녕하세요 호기님. 강의를 수강해주셔서 감사합니다.
질문 잘 짚어주셨습니다. 결론부터 말하면 교재가 맞는데, 표기가 헷갈리게 되어 있어서 생긴 혼동입니다.
1) p의 아래첨자는 '행동 번호'가 아니라 '도착 상태 번호'입니다
π₁, π₂의 아래첨자는 행동(A1, A2)을 가리키지만, p₁, p₂의 아래첨자는 행동이 아니라 어디에 도착하느냐를 가리킵니다.
p₁ = S2에 도착할 확률 (0.7)
p₂ = S3에 도착할 확률 (0.3)
그래서 "π₂에는 p₂를 곱해야 하지 않나"라는 생각이 자연스럽게 드는 건데, π₂와 p₂는 서로 짝이 되는 값이 아닙니다.
2) 확률이 두 단계로 일어난다고 보시면 됩니다
MDP에서 다음 상태가 정해지기까지는 두 번의 확률적 사건을 거칩니다.
1단계 — 정책: S1에서 어떤 행동을 고를까? → A1은 40%, A2는 60%
2단계 — 상태전이: 그 행동을 했을 때 어디로 갈까? → 각 행동마다 S2/S3로 갈 확률이 있음
지금 구하려는 건 "t2에 S2에 있을 확률" 하나입니다. S2에 도착하는 길은 두 가지예요.
S1 ─ A1 (0.4) ─→ S2로 갈 확률 0.7 → 0.4 × 0.7 = 0.28
└ A2 (0.6) ─→ S2로 갈 확률 0.7 → 0.6 × 0.7 = 0.42
합계 = 0.70두 경로 모두 도착지가 S2이므로, 곱해지는 건 둘 다 "S2로 갈 확률"입니다. 여기에 π₂ × p₂를 쓰면 그건 A2를 고른 뒤 S3로 가는 경우가 되어, 지금 묻는 질문(S2에 있을 확률)과 다른 값을 계산하게 됩니다.
참고로 S3에 있을 확률도 같은 방식으로 구합니다.
0.4 × 0.3 + 0.6 × 0.3 = 0.3 → 0.7 + 0.3 = 1
3) 일반식으로 쓰면 이렇습니다

교재 예시를 이 식의 표기로 다시 쓰면 헷갈릴 일이 없습니다.
P(S2 | S1, A1) = 0.7
P(S2 | S1, A2) = 0.7
P(S2 | S1) = 0.4 × 0.7 + 0.6 × 0.7 = 0.7
4) 그런데 질문하신 직관도 반은 맞습니다
"행동이 달라지면 전이확률도 달라져야 하는 것 아닌가" — 그게 MDP의 본질이 맞습니다. 다만 이 예시는 두 행동의 전이확률을 일부러 똑같이(0.7 / 0.3) 잡아둔 특수한 경우입니다. 그래야 MRP 결과(0.7)와 MDP 결과(0.7)가 같아지면서, 정책이 끼어들어도 계산 구조가 어떻게 확장되는지만 깔끔하게 보이거든요.
만약 행동마다 전이확률이 다르다면 결과도 달라집니다. 예를 들어 A1은 S2로 0.7, A2는 S2로 0.2라고 하면
0.4 × 0.7 + 0.6 × 0.2 = 0.28 + 0.12 = 0.40
이렇게 MRP와는 다른 값이 나오고, 이때부터 "어떤 정책을 쓰느냐에 따라 미래가 달라진다"는 MDP의 핵심이 드러납니다. 슬라이드의 예시는 그 직전 단계, 즉 계산 방법만 익히는 단계라고 보시면 됩니다.
감사합니다.
0
안녕하세요, 인프런 AI 인턴입니다. 호기님.
질문하신 내용은 정책별로 상태전이확률을 구분해야 하는지에 대한 부분입니다.
일반적으로 MDP에서 정책을 고려한 상태전이확률은 다음과 같이 계산합니다.
[
P^\pi(s’|s)=\sum_a \pi(a|s)P(s’|s,a)
]
즉, 각 행동을 선택할 확률인 정책 (\pi(a|s))과 해당 행동을 했을 때의 상태전이확률 (P(s’|s,a))을 곱한 뒤 모두 더합니다.
따라서 행동 1과 행동 2에 따른 상태전이확률이 서로 다르다면 다음처럼 계산하는 것이 맞습니다.
[
\pi_1 \times p_1 + \pi_2 \times p_2
]
다만 교재의 예시에서는 정책 1과 정책 2를 선택하더라도 목표 상태로 이동할 상태전이확률이 동일하게 (p_1=0.7)이라고 가정했기 때문에 다음처럼 표현된 것입니다.
[
\pi_1 \times p_1+\pi_2 \times p_1
=0.4\times0.7+0.6\times0.7
=0.7
]
즉, 정책 2에 반드시 상태전이행렬 2를 곱하지 않는다는 의미가 아니라, 해당 예시에서는 두 정책을 선택했을 때의 특정 상태로 이동할 확률이 동일했기 때문에 같은 (p_1)을 사용한 것입니다. 행동 2를 선택했을 때의 상태전이확률이 (p_2)라면 호기님께서 생각하신 것처럼 (\pi_2 \times p_2)로 계산해야 합니다.

관련하여 정책과 상태전이확률을 함께 고려하는 예시는 아래 기존 답변에서도 확인하실 수 있습니다.
해당 답변에서도 정책 확률과 상태전이확률을 각각 곱한 뒤 합산하여, 정책을 반영한 최종 상태전이확률을 계산하는 과정을 설명하고 있습니다.
저는 질문자님의 이해를 돕고자 지식공유자님의 기존 답변을 참고하여 유사한 답변 링크를 추천해드리고 있습니다.
현재 베타 기능으로 답변이 만족스럽지 않을 수 있는 점 양해 부탁드립니다. 🙏
추가적으로 궁금한 점이 있으시면, 이어서 질문해 주세요. 곧 지식공유자께서 답변해 주실 것입니다.
블로그 내용 정리
0
3
0
매수 실행 시점 관련
0
8
0
영상 다운로드는 안되나요?
0
14
1
수강자료 다운로드 관련 문의
0
22
2
Opus/Sonnet 버전 관련 문의
1
21
2
"run_nvidia_gpu.bat" 실행후
0
17
1
섹션2 질문이요
1
25
2
섹션 2
0
19
1
섹션1.9 질문입니다!
1
37
3
웹서비스 방법
0
34
2
MCP 정의가 잘못되어 있음 (Chapter2)
0
33
1
수강 연장 문의드립니다.
0
33
2
13. (App 2) 기본기 훈련 에서
0
34
1
채점 프로그램 미작동
0
28
2
챌린지 시작일 문의
0
39
0
2. 어떤 도구를 사용하는 것이 가장 유리할까? 강의 중
0
32
1
안녕하세요 ppt 자료 메일로 부탁드립니다
0
24
1
11차시 Antigravity IDE 설치 후
0
34
1
마르코프 결정과정 질문
0
125
2
stable_baseline3 설치 안됨
0
423
2
자산배분비율 변경 백테스트와 어떻게 다르죠?
0
160
2
소스코드 없어요
0
154
2
강화학습, 머신러닝에 관심 있는 웹 개발자입니다. 수학적 난이도 때문에 실무 활용이 고민됩니다.
0
243
1
실습 프로그램 파일 제공 문의
0
118
1





