inflearn logo
강의

Khóa học

Chia sẻ kiến thức

Học tăng cường tất cả trong một: từ cơ bản, thuật toán mới nhất, đến ứng dụng thực tế

3.1.강화학습 기본 알고리즘-마르코프 결정과정

2

naite091593

3 câu hỏi đã được viết

0

안녕하세요 좋은강의 잘듣고있습니다!

MDP 기본개념설명해주신 부분 중 3.1에서 교재 8페이지에 MDP를 계산하는 과정에서 정책1과 상태전이메트릭스1을 곱하고, 정책2도 상태전이메트릭스1에 곱한다고 나와있는데 이 부분이 잘 이해되지 않아 질문합니다. 정책이라는 것이 행동을 할 확률을 나타내는 것이므로 정책2도 상태전이메트릭스2에 곱하는게 맞는것이 아닌가라고 생각하였기에 이 부분이 궁금합니다

image.png

!

python 인공신경망 강화학습 fine-tuning 최적화이론

Câu trả lời 1

0

communityai8509

안녕하세요, 인프런 AI 인턴입니다. 호기님.

질문하신 내용은 정책별로 상태전이확률을 구분해야 하는지에 대한 부분입니다.

일반적으로 MDP에서 정책을 고려한 상태전이확률은 다음과 같이 계산합니다.

[
P^\pi(s’|s)=\sum_a \pi(a|s)P(s’|s,a)
]

즉, 각 행동을 선택할 확률인 정책 (\pi(a|s))과 해당 행동을 했을 때의 상태전이확률 (P(s’|s,a))을 곱한 뒤 모두 더합니다.

따라서 행동 1과 행동 2에 따른 상태전이확률이 서로 다르다면 다음처럼 계산하는 것이 맞습니다.

[
\pi_1 \times p_1 + \pi_2 \times p_2
]

다만 교재의 예시에서는 정책 1과 정책 2를 선택하더라도 목표 상태로 이동할 상태전이확률이 동일하게 (p_1=0.7)이라고 가정했기 때문에 다음처럼 표현된 것입니다.

[
\pi_1 \times p_1+\pi_2 \times p_1
=0.4\times0.7+0.6\times0.7
=0.7
]

즉, 정책 2에 반드시 상태전이행렬 2를 곱하지 않는다는 의미가 아니라, 해당 예시에서는 두 정책을 선택했을 때의 특정 상태로 이동할 확률이 동일했기 때문에 같은 (p_1)을 사용한 것입니다. 행동 2를 선택했을 때의 상태전이확률이 (p_2)라면 호기님께서 생각하신 것처럼 (\pi_2 \times p_2)로 계산해야 합니다.

MDP 상태전이확률 계산 예시

관련하여 정책과 상태전이확률을 함께 고려하는 예시는 아래 기존 답변에서도 확인하실 수 있습니다.

해당 답변에서도 정책 확률과 상태전이확률을 각각 곱한 뒤 합산하여, 정책을 반영한 최종 상태전이확률을 계산하는 과정을 설명하고 있습니다.

저는 질문자님의 이해를 돕고자 지식공유자님의 기존 답변을 참고하여 유사한 답변 링크를 추천해드리고 있습니다.
현재 베타 기능으로 답변이 만족스럽지 않을 수 있는 점 양해 부탁드립니다. 🙏
추가적으로 궁금한 점이 있으시면, 이어서 질문해 주세요. 곧 지식공유자께서 답변해 주실 것입니다.

매수 실행 시점 관련

0

7

0

영상 다운로드는 안되나요?

0

13

0

수강자료 다운로드 관련 문의

0

21

2

Opus/Sonnet 버전 관련 문의

1

21

2

"run_nvidia_gpu.bat" 실행후

0

15

1

섹션2 질문이요

1

21

2

섹션 2

0

17

1

섹션1.9 질문입니다!

1

34

3

웹서비스 방법

0

34

2

MCP 정의가 잘못되어 있음 (Chapter2)

0

31

1

수강 연장 문의드립니다.

0

33

2

13. (App 2) 기본기 훈련 에서

0

34

1

채점 프로그램 미작동

0

28

2

챌린지 시작일 문의

0

39

0

2. 어떤 도구를 사용하는 것이 가장 유리할까? 강의 중

0

32

1

안녕하세요 ppt 자료 메일로 부탁드립니다

0

24

1

11차시 Antigravity IDE 설치 후

0

34

1

링크드 리스트 중간 삽입삭제 시간복잡도 질문

0

37

2

마르코프 결정과정 질문

0

123

2

stable_baseline3 설치 안됨

0

423

2

자산배분비율 변경 백테스트와 어떻게 다르죠?

0

160

2

소스코드 없어요

0

154

2

강화학습, 머신러닝에 관심 있는 웹 개발자입니다. 수학적 난이도 때문에 실무 활용이 고민됩니다.

0

243

1

실습 프로그램 파일 제공 문의

0

117

1