inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

프로그래머를 위한 강화학습(저자 직강)

REINFORCE 알고리즘 프로그래밍

MyModel(tf.keras.Model)에 action matrix와 reward와 관련해서

346

bs Jeon

작성한 질문수 12

0

training시에 필요한 action matrix와 reward를 받기위해 inputs에 dummy로 input_action_matrixs와 input_rewards를 정의하고 있는것처럼 보이는데요.

 

이렇게 하지않고 MyModel에 예를들면 setActionMatrixs, setRewards 이런식으로 함수를 정의하고 fit를 호출하기전에 set함수를 호출하여도 될것 같은데, 이렇게 했을때 단점이 있나요?

인공신경망 강화학습

답변 1

0

아인폴랩

안녕하세요 bs Jeon님

강의를 수강 해 주셔서 감사합니다.

말씀하신 것처럼

self.DUMMY_ACTION_MATRIX, self.DUMMY_REWARD = np.zeros((1,1,self.action_size)), 
                                              np.zeros((1,1,self.value_size))

위 코드는 변수 초기화를 위해서 사용하는 것입니다.

위와 같은 방식으로 사용하면 클래스가 생성되는 시점에 변수가 자동으로 초기화됩니다.

또한, bs Jeon님 의견과 같이 변수 초기화를 담당하는 set 함수를 정의해서 객체를 생성하는 시점에 set 함수를 호출해서 초기화할 수도 있습니다. 성능 상의 차이는 없고 단지 코드 구현 상의 차이입니다. 본인의 코딩 스타일에 맞게 사용하시면 됩니다.

감사합니다.

 

이 강의 zboz7보드에서도 실행 가능한가요?

1

40

1

02_TENSOR.md자료

0

46

1

pytorch 설치 업데이트좀요

0

66

2

MA-POCA 알고리즘 응용 질문

0

53

1

강의 자료 열람 요청이 안되네요

0

46

1

실습 코드

0

68

2

aws deep racer 이제 못하는건가요?

0

80

2

import torch가 안되는 경우는 어떻게 하나요?

0

109

1

소리가 겹쳐서 들려요

0

88

2

전 강의와 전혀 이어지지가 않음

0

82

1

pytorch local 설치 옵션에 conda 가 없습니다.

0

105

3

강화학습저장 및 로드

0

116

1

수업 하실 때 활용하시는 강의 자료를 제공 받을 수 있는지 문의 드립니다

0

114

2

마르코프 결정과정 질문

0

122

2

stable_baseline3 설치 안됨

0

423

2

최적화

0

56

0

소스코드

0

60

1

<대규모 언어 모델, 핵심만 빠르게!> 쿠폰은 언제쯤 발급되나요?

0

107

3

section 3 이후는 언제 보게 되나요?

0

101

2

실습강의 소스코드

0

108

2

환경구축에 대해서

0

107

2

2.7 TD 상태가치함수

1

300

1

cartpole_DQN 에러

0

451

2

PPO에서 min()을 사용하는 이유가 궁금합니다

0

637

1