안녕하세요. 강의 정말 잘 듣고 있습니다. 질문이 있어 글 남겨봅니다. 행동가치함수는 그 상태에서 행동을 통해 즉시보상을 얻는 것이고, 상태가치함수는 그 상태에서 정책을 쭉 따라가면서 가치함수를 계산한다는 제 이해가 맞을까요? 상태 가치가 제일 높은 것을 선택하는 것이 최적 정책이고, 최적 정책을 만들기 위해서는 각 상태에서 결정적 최적정책을 통해 최적행동가치함수의 값이 가장 큰 행동을 선택한다는 제 이해가 맞을까요? 좋은 하루 되시길 바랍니다.
[WinError 1114] DLL 초기화 루틴을 실행할 수 없습니다. Error loading "c:\Users\testos\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\lib\c10.dll" or one of its dependencies. 이렇게 오류가 뜨면서 설치가 되지 않습니다ㅠㅠ 프로그램은 visual studio code 사용중입니다!
해당 강화학습 모델이 어떤 의미를 가지는지 궁금합니다. 그냥 자산배뷴비율 백테스트로 gridsearch식으로 비율을 다르게 해서 지표가 가장 좋은걸 찾는 방법과 강화학습을 사용한것과 어떻게 다른것인지 궁금하네요. 강화학습을 사용했기때문에 리밸런싱 시기마다 자산 등락 경향을 참고해서 다음 최적의 리밸런싱 비율을 구하는건가요?
저는 현직 웹 개발자로, 강화학습 및 머신러닝에 평소 큰 관심이 있어서 관련 강의를 꾸준히 듣고 있습니다. 최근 강의들은 분량이 짧아 접근성은 좋은데, 수학적 표현(수식, 기호)이 등장할 때마다 의도를 즉각적으로 해석하지 못하고 혼란을 겪습니다. 강의자 분께서는 '필요한 수학적 개념은 강의 중에 그때그때 이해하면 된다'고 안내하지만, 저에게는 수학적 진입장벽이 너무 높게 느껴지고, 결국 코드의 동작 방식만 어렴풋이 이해할 뿐 수학적 본질을 놓치게 되어 데이터 분석 분야 학습에 자꾸 실패감을 경험하고, 많은 관련 강의를 듣기를 실패한 경험들이 많습니다. 실무 개발자로서 강화학습과 머신러닝을 업무에 적용하고 싶은데, 수학적 배경이 깊지 않아도 어느 정도까지는 실무 적용 가능한 수준의 이해가 가능한지 , 수학적 난관을 만났을 때 어떤 접근법과 학습 전략이 효과적인지 , 제대로 이해하고 있다는 것을 확인할 수 있는 메타인지 방법이나 공부 전략은 무엇인지 현실적이고 구체적인 조언을 부탁드립니다.
안녕하세요 최적화이론1을 거의 완강한 수강생입니다. 강의중에 몇몇 내용들은 최적화이론2에서 다룰거라고 몇 번 말씀을 하셨는데, 아직 최적화이론2 강의가 있는거 같지 않아서 여쭤봅니다. 혹시 최적화이론2 강의 계획이 있으신가요? 최적화이론1 강의가 도움이 너무 많이 되어서 2 강의도 꼭 듣고 싶습니다.