(PPO 실습 2) total_loss 구하는 코드에서 action entropy 는 어떻게 계산된 것인지 궁금합니다.
우선 좋은 수업 감사드립니다.
PPO 알고리즘 수업에서 PPO Actor-Critic Network 의 전체 손실 값은 clipped surrogate objective - c1 * value loss (critic loss) + c2 * action entropy 라고 배웠는데, 관련 부분에 대한 코드를 보면
actor_loss = -torch.min(surr1, surr2).mean()
critic_loss = F.mse_loss(value, _ret).mean()
total_loss = actor_loss + critic_loss로 action entropy 에 대한 연산은 없는 것 같아 보입니다. 혹시 제가 잘못 알고 있거나, 다른 부분에서 이미 고려된 것이라면, 알려주시길 부탁 드립니다.
아니면 고려하지 않아도 되는 조건이라면 어떤 이유가 있는지 알고 싶습니다.
감사합니다.
回答 1
1
용곤님 안녕하세요!
말씀해주신대로 PPO에서 action entropy값을 손실함수로 사용할 수 있습니다.
다만 해당 값은 선택적인 부분이라고 생각하고, 강의 환경들에서 clipped surrogate objective 값만 가지고 학습이 잘 되어서 생략하였습니다!
감사합니다.
영상이 안나옵니다. 그냥 빈공간이에요
1
10
3
layout group의 종류 3가지 실무 적합활용이 궁금합니다.
0
11
1
수박게임 자료 받았는데 plante05, 06이 없습니다.
0
28
1
14강 녹음이 안되어 있습니다
0
40
1
유니티webgl 과 안티그래비티를 협업시키고 싶습니다.
0
47
2
소스를 받을 수 있는 링크가 있을까요?
0
78
2
프로덕션 부분 사용 불가
0
76
2
접근지정자
0
73
2
in-app purchasing 버튼의 install 버튼이 비활성화되어있을때 어떻게 해결해야하나요 ?
0
58
2
유니티 제외 설치한 프로그램들 및 파일 삭제 방법
0
63
1
깃허브에서 콤피유아이 매니저 설치하는게 안됩니다.
0
86
2
5강, 오류 수정과 관련해서
0
71
2
컴퓨터를 껐다가 클로드 코드 다시 키는 방법 알려주세요.
0
72
1
MA-POCA 알고리즘 응용 질문
0
52
1
Pivot을 마우스로 클릭하고 드래그해도 움직이 않아서 혹시 아시는 부분이 있나 해서 문의 남깁니다.
0
65
1
카메라가 많아지면 렌더링 비용이 커지나요?
0
51
1
3:56에 폰트 불러온 과정이 궁금합니다 ㅠㅠ
0
83
3
Spider와 Monster 구현 방식을 구분한 이유
1
47
1
Sprute Sheet에 대해서.
0
75
1
ResourceManager 클래스 관련 질문
1
87
2
FBX chan 모델
0
85
1
닷지 ckpt 모델 파일을 onnx변환 후 unity에서 추론
0
196
2
예제 파일 실행 오류
0
329
1
PPO 알고리즘을 ml-agents learn 명령어로 학습 및 추론할때 메소드 호출 순서 질문
0
396
1

