3.1.강화학습 기본 알고리즘-마르코프 결정과정
1
작성한 질문수 3
안녕하세요 좋은강의 잘듣고있습니다!
MDP 기본개념설명해주신 부분 중 3.1에서 교재 8페이지에 MDP를 계산하는 과정에서 정책1과 상태전이메트릭스1을 곱하고, 정책2도 상태전이메트릭스1에 곱한다고 나와있는데 이 부분이 잘 이해되지 않아 질문합니다. 정책이라는 것이 행동을 할 확률을 나타내는 것이므로 정책2도 상태전이메트릭스2에 곱하는게 맞는것이 아닌가라고 생각하였기에 이 부분이 궁금합니다

!
답변 0
매수 실행 시점 관련
0
7
0
영상 다운로드는 안되나요?
0
13
0
수강자료 다운로드 관련 문의
0
21
2
Opus/Sonnet 버전 관련 문의
1
21
2
"run_nvidia_gpu.bat" 실행후
0
15
1
섹션2 질문이요
1
21
2
섹션 2
0
17
1
섹션1.9 질문입니다!
1
34
3
웹서비스 방법
0
34
2
MCP 정의가 잘못되어 있음 (Chapter2)
0
31
1
수강 연장 문의드립니다.
0
33
2
13. (App 2) 기본기 훈련 에서
0
34
1
채점 프로그램 미작동
0
28
2
챌린지 시작일 문의
0
39
0
2. 어떤 도구를 사용하는 것이 가장 유리할까? 강의 중
0
32
1
안녕하세요 ppt 자료 메일로 부탁드립니다
0
24
1
11차시 Antigravity IDE 설치 후
0
34
1
링크드 리스트 중간 삽입삭제 시간복잡도 질문
0
37
2
마르코프 결정과정 질문
0
122
2
stable_baseline3 설치 안됨
0
423
2
자산배분비율 변경 백테스트와 어떻게 다르죠?
0
160
2
소스코드 없어요
0
154
2
강화학습, 머신러닝에 관심 있는 웹 개발자입니다. 수학적 난이도 때문에 실무 활용이 고민됩니다.
0
243
1
실습 프로그램 파일 제공 문의
0
117
1





