inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

강화학습 올인원: 기초, 최신 알고리즘, 실무 활용까지

3.1.강화학습 기본 알고리즘-마르코프 결정과정

1

호기

작성한 질문수 3

0

안녕하세요 좋은강의 잘듣고있습니다!

MDP 기본개념설명해주신 부분 중 3.1에서 교재 8페이지에 MDP를 계산하는 과정에서 정책1과 상태전이메트릭스1을 곱하고, 정책2도 상태전이메트릭스1에 곱한다고 나와있는데 이 부분이 잘 이해되지 않아 질문합니다. 정책이라는 것이 행동을 할 확률을 나타내는 것이므로 정책2도 상태전이메트릭스2에 곱하는게 맞는것이 아닌가라고 생각하였기에 이 부분이 궁금합니다

image.png

!

python 인공신경망 강화학습 fine-tuning 최적화이론

답변 0

매수 실행 시점 관련

0

7

0

영상 다운로드는 안되나요?

0

13

0

수강자료 다운로드 관련 문의

0

21

2

Opus/Sonnet 버전 관련 문의

1

21

2

"run_nvidia_gpu.bat" 실행후

0

15

1

섹션2 질문이요

1

21

2

섹션 2

0

17

1

섹션1.9 질문입니다!

1

34

3

웹서비스 방법

0

34

2

MCP 정의가 잘못되어 있음 (Chapter2)

0

31

1

수강 연장 문의드립니다.

0

33

2

13. (App 2) 기본기 훈련 에서

0

34

1

채점 프로그램 미작동

0

28

2

챌린지 시작일 문의

0

39

0

2. 어떤 도구를 사용하는 것이 가장 유리할까? 강의 중

0

32

1

안녕하세요 ppt 자료 메일로 부탁드립니다

0

24

1

11차시 Antigravity IDE 설치 후

0

34

1

링크드 리스트 중간 삽입삭제 시간복잡도 질문

0

37

2

마르코프 결정과정 질문

0

122

2

stable_baseline3 설치 안됨

0

423

2

자산배분비율 변경 백테스트와 어떻게 다르죠?

0

160

2

소스코드 없어요

0

154

2

강화학습, 머신러닝에 관심 있는 웹 개발자입니다. 수학적 난이도 때문에 실무 활용이 고민됩니다.

0

243

1

실습 프로그램 파일 제공 문의

0

117

1