inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

173만명의 커뮤니티!! 함께 토론해봐요.

MA-POCA 알고리즘 응용 질문

해결됨

유니티 머신러닝 에이전트 완전정복 (응용편)

EscapeRoom 환경에서 MA-POCA 쓸 때 actor는 에이전트가 개별적으로 사용하는 것으로 설계가 되어 있는데요. 유니티 상에서 에이전트들은 셋이 다 똑같이 생겨서 구분이 안되어 있는데, 매 에피소드마다 파이썬에서 부여되는 에이전트 id는 유니티 상에서 만들어둔 에이전트와 항상 같은 object로 매칭되는 것인지 궁금합니다. 코드를 응용해보려고 하는데 엑터 셋의 역할고정이 가능할지 궁금해서요! 또 한 에피소드에서 어떤 에이전트는 trap에 빠지고 어떤 에이전트는 살아남은 상태에서 에피소드가 종료될텐데.. 그럼 그 다음 에피소드에서는 그것과 관계없이 언제나 에이전트 셋 다 리셋되는 건지, trap에 빠진 에이전트만 리셋되는 건지도 궁금합니다.

  • unity
  • 강화학습
  • unity-ml-agents
최정연 댓글 1 좋아요 0 조회수 48

aws deep racer 이제 못하는건가요?

해결됨

AWS DeepRacer로 배우는 인공지능과 자율주행

aws deepracer console 이없고, 찾아보니 서비스 종료되었다는데, 그럼 이제 못하는건가요? 강의를 구매했는데 서비스 종료된거라고 해서 당황스러운 마음에 문의드립니다.

  • 강화학습
  • 자율주행
  • deepracer
srrd1357 댓글 2 좋아요 0 조회수 77

소리가 겹쳐서 들려요

미해결

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

어떤 강의는 괜찮은데 대부분 강의에서 소리가 두개씩 겹쳐 들립니다. 들어보면 같은 내용인데 강의 내용(슬라이드 포인트)보다 0.5초 정도 더 빨리 작게 들리네요.

  • python
  • 딥러닝
  • 강화학습
  • pytorch
박기선 댓글 2 좋아요 0 조회수 85

전 강의와 전혀 이어지지가 않음

미해결

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

전 강의와 전혀 이어지지가 않음 다운받기를 한 적도 없고, 전 강의에서는 pip install만 진행했고, 무슨 디렉토리가 갑자기 튀어나오는데 어떤 디렉토리를 만드라고 하는지 얘기한적도 없음. 엉터리임

  • python
  • 딥러닝
  • 강화학습
  • pytorch
댓글 1 좋아요 0 조회수 80

pytorch local 설치 옵션에 conda 가 없습니다.

해결됨

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

pytorch local 설치 옵션에 conda 가 없습니다.

  • python
  • 딥러닝
  • 강화학습
  • pytorch
inhokim 댓글 3 좋아요 0 조회수 101

강화학습저장 및 로드

해결됨

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

오영제 선생님 강의 잘 듣고 있고 감사드립니다. 드리고 싶은 질문은 강화학습은 학습 후 훈련내용을 어떻게 저장하고 필요시 어떻게 로드하는 지 궁금하니다.

  • python
  • 딥러닝
  • 강화학습
  • pytorch
nkhwi 댓글 1 좋아요 0 조회수 112

마르코프 결정과정 질문

미해결

강화학습 올인원: 기초, 최신 알고리즘, 실무 활용까지

안녕하세요. 강의 정말 잘 듣고 있습니다. 질문이 있어 글 남겨봅니다. 행동가치함수는 그 상태에서 행동을 통해 즉시보상을 얻는 것이고, 상태가치함수는 그 상태에서 정책을 쭉 따라가면서 가치함수를 계산한다는 제 이해가 맞을까요? 상태 가치가 제일 높은 것을 선택하는 것이 최적 정책이고, 최적 정책을 만들기 위해서는 각 상태에서 결정적 최적정책을 통해 최적행동가치함수의 값이 가장 큰 행동을 선택한다는 제 이해가 맞을까요? 좋은 하루 되시길 바랍니다.

  • python
  • 인공신경망
  • 강화학습
  • fine-tuning
  • 최적화이론
최승무 댓글 2 좋아요 0 조회수 120

stable_baseline3 설치 안됨

미해결

강화학습 올인원: 기초, 최신 알고리즘, 실무 활용까지

[WinError 1114] DLL 초기화 루틴을 실행할 수 없습니다. Error loading "c:\Users\testos\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\lib\c10.dll" or one of its dependencies. 이렇게 오류가 뜨면서 설치가 되지 않습니다ㅠㅠ 프로그램은 visual studio code 사용중입니다!

  • python
  • 인공신경망
  • 강화학습
  • fine-tuning
  • 최적화이론
최승무 댓글 2 좋아요 0 조회수 415

소스코드

미해결

모두를 위한 딥러닝 - Deep Reinforcement Learning

강의에서 사용하신 소스코드는 어디에서 받을 수 있나요?

  • 딥러닝
  • 강화학습
syshim 댓글 1 좋아요 0 조회수 58

설치 프로그램 버전 질문있습니다.

미해결

유니티 머신러닝 에이전트 완전정복 (기초편)

현재 프로그램들의 버전이 꽤나 많이 나온 것 같은데 전부 강의에 맞춰서 설치하는게 좋을까요?

  • unity
  • 머신러닝
  • 강화학습
  • unity-ml-agents
황강희 댓글 2 좋아요 0 조회수 120

env 환경경로 입력방법

미해결

유니티 머신러닝 에이전트 완전정복 (기초편)

안녕하세요! 9강에서 3d ball 학습할 때 적는 env 경로는 프로젝트에서 3d ball을 빌드한 다음에 적어야 하는 경로일까요?

  • unity
  • 머신러닝
  • 강화학습
  • unity-ml-agents
대롱대롱 댓글 2 좋아요 0 조회수 114

16:07슬라이드에소 헷갈리는 부분이 있습니다

미해결

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

Policy Network(Q)와 일반적인 Q-learning 문제에서의 behaviour policy(b)가 각자 하는 역할이 비슷한거 같은데, 만약 틀리다면 추가적인 설명을 부탁드려도 될까요? 왜냐하면, '탐험'의 성격?을 각각의 net과 policy가 수행한다고 생각했습니다. 우선 network관점에서는 특정 행동 결정 규칙에 따라 weight를 형성하는데 이때 그리디 action에 대한 value를 추정(max함수)하는 target network에 비해선 '활용'보다는 '탐험'을 하고 있다고 생각합니다 -> 행동 규칙에 따라 transition을 입력으로 받아 weight를 업데이트 하기 때문. 이로 인해 일반적인 Q-learning에서의 b도 max를 출력하는 target policy, pi대신 e-그리디 정책으로 일정 확률 e로 모든 행동을 선택할 수 있는 기믹을 활용하여 '탐험'을 하기 때문에 위와 같은 생각을 하였습니다.

  • python
  • 딥러닝
  • 강화학습
  • pytorch
최규형 댓글 2 좋아요 0 조회수 107

미분 결과가 왜 저렇게 나오는지 궁금합니다.

미해결

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

6:49쯤에, MSBE = (delta_{t+1})^2의 미분 결과가 2*(delta_{t+1})* (\partial(delta_{t+1}}); 합성함수의 미분, 의 형태가 아닌 화면에 나오는 것처럼 미분이 되는지 궁금합니다. 추가로 policy improvement step에서 각 action에 대해서 value가 높은 weight로 parameters을 업데이트 하면서 자동적으로 최적pi를 찾게 된다고 보는 게 맞는 이해일까요?

  • python
  • 딥러닝
  • 강화학습
  • pytorch
최규형 댓글 1 좋아요 0 조회수 104

Taxi-v3에 대한 두 가지질문

미해결

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

Taxi가 랜덤하게 init된 손님와 목적지의 위치를 아는 이유는 observations 환경이라 그런 걸까요? 랜덤하게 목적지와 손님의 위치가 설정되더라도 과업을 어느정도 완벽히 수행하게 되는 원리는 어떤 특정 지점에 대해서 손님의 위치까지의 경로 계획을 위한 행동 가치에 대한 훈련과 그 손님의 위치에서 목적지를 향한 경로 계획에 대해서의 가치 훈련을 수행 했기 때문으로 보는 것이 맞을까요?

  • python
  • 딥러닝
  • 강화학습
  • pytorch
최규형 댓글 1 좋아요 0 조회수 76

자산배분비율 변경 백테스트와 어떻게 다르죠?

미해결

강화학습 올인원: 기초, 최신 알고리즘, 실무 활용까지

해당 강화학습 모델이 어떤 의미를 가지는지 궁금합니다. 그냥 자산배뷴비율 백테스트로 gridsearch식으로 비율을 다르게 해서 지표가 가장 좋은걸 찾는 방법과 강화학습을 사용한것과 어떻게 다른것인지 궁금하네요. 강화학습을 사용했기때문에 리밸런싱 시기마다 자산 등락 경향을 참고해서 다음 최적의 리밸런싱 비율을 구하는건가요?

  • python
  • 인공신경망
  • 강화학습
  • fine-tuning
  • 최적화이론
poiuy1709 댓글 2 좋아요 0 조회수 159

그림에 대해서 잘 이해가 안됩니다.

미해결

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

9분 52초의 Policy Improvement table에서는 blue statement를 통과해서 가는데 optimal이라고 화살표가 나아 있는데, 14분 6초에서는 blue statement를 거치지 않고 돌아서 가는 것이 optimal이라고 화살표가 표시되어 있습니다. 그냥 theta의 값을 두고 iteration을 한 차이 인걸까요?

  • python
  • 딥러닝
  • 강화학습
  • pytorch
최규형 댓글 1 좋아요 0 조회수 77

stochastic state 관련

미해결

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

안녕하세요. 약 4분 경, value function 을 구할때 stochastic 하게 state가 결정된다면, 각 state가 결정될 확률값은 고려하지 않아도 되는건가요? 예를들면, class1에서 class2로 갈 확률과 facebook 으로 갈 확률이 0.5 인데, 그렇다면 각 첫번째 단계에서 reward x 확률값(0.5) 이런식으로 고려하지는 않아도 되는것인지 질문드립니다. 감사합니다.

  • python
  • 딥러닝
  • 강화학습
  • pytorch
능함가 댓글 2 좋아요 0 조회수 97

reward, value functnio

해결됨

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

안녕하세요. 강화학습 자체가 reward를 최대화 하는 방향으로 학습을 하는 것인데, 그럼 결국 reward 를 최대화 하는 방향인 것인지, value function을 최대화 하는 방향인 것인지 헷갈려서 질문드립니다.

  • python
  • 딥러닝
  • 강화학습
  • pytorch
능함가 댓글 2 좋아요 0 조회수 87

전이확률 / stochastic env.

미해결

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

안녕하세요. 그럼 stochastic env. 에서 특정 action을 선택해서 행했을때, 그 action이 이루어 지는지 다른 action이 이루어 지는지에 대한 확률이 transition probability(전이확률) 이 되는 것이라는 말씀인지요? 감사합니다.

  • python
  • 딥러닝
  • 강화학습
  • pytorch
능함가 댓글 1 좋아요 0 조회수 101

확률론적 policy 관련

해결됨

강화학습 입문에서 Deep Q-learning/Policy Gradient까지

안녕하세요. 전이확률과 stochastic policy 가 헷갈려서 그런데, stochastic policy 에서 특정 action을 할 확률이 전이확률이 되는 건가요? 아니면, 두개가 구별된 개념인 것인가요? 감사합니다.

  • python
  • 딥러닝
  • 강화학습
  • pytorch
능함가 댓글 1 좋아요 0 조회수 62

인기 태그

인프런 TOP Writers

주간 인기글