안녕하세요. lda를 사용한 부분은 제 4회 기출문제 리뷰인데요. str함수를 사용해서 예측해야하는 'Segmentation' 변수의 형태를 파악하면 알 수 있습니다. 실제 시험에서는 시험문제가 제공되는 좌측의 설명을 보시면 Class의 숫자를 알 수가 있습니다. 따라서, 기본적으로 시험문제를 확인하시면 알 수가 있습니다. (체험환경에서도 동일하게 확인이 가능합니다. ( 링크 )를 여시면 성별을 예측한다고 나와있습니다.) 또한, 제공받은 데이터셋을 로딩해서 str함수를 통해서도 알 수 있습니다. 감사합니다.
안녕하세요. 많은 분들이 궁금해하는 내용이긴 합니다. 지금까지는 주로 코드와 무관하게 제출하는 답만 맞으면 정답으로 인정되는 것으로 보입니다. 모든 응시자의 코드를 리뷰하기 어렵기 때문으로 보입니다. 그러나 절대적이다 라고 말씀드리기는 어려운 점 양해부탁드립니다. 감사합니다.
안녕하세요. 회귀지표는 말씀하신대로 뭔가 사람이 와닿은 백분율 개념보다는 주로 RMSE로 평가를 합니다. 다만, RMSE / MAE등은 본래의 실제 Target값의 크기 때문에 가늠이 되지 않을 수 있습니다. 시험과 무관한 관점에서 설명드리면, 그런 경우 MAPE를 많이 사용합니다. MAPE의 정의는 구글링하시면 많은 자료들을 얻으실 수 있고, 패키지나 단순한 함수로 쉽게 계산이 가능합니다. 컨셉상으로 (수학적 설명은 구글링 참고하시면 좋을 것 같습니다.) 예측값이 실제값에서 얼마나 벗어났는지를 표현하고 있으며 0%에 가까울수록 일반적으로 성능이 높습니다. 한 번 참고해보시면 좋을 것 같습니다. 감사합니다.
안녕하세요. 제가 세션2의 녹화를 가장 최근에 했는데, randomForest만을 사용하는 방향으로 시험 대응방안을 드렸습니다. 만약에 세 가지 알고리즘을 사용하시고 F1 스코어값을 평가지표로 활용하신다면 제시해주신 방향이 맞는 방향입니다. 다만 굳이 세 개의 모델을 실행하고 F1 스코어를 비교하는 것보다, randomforest 단일 모델로 대응하는 것이 시험을 더 쉽게 통과하는 방법이라고 보여집니다. 코드 실행에 제한 시간(1분) 이 있기 때문에 복잡한 방법보다는 단순한 방법으로 시험 통과에 목적을 두는 편이 나으며, 제대로만 실행된다면 상기 방법을 활용해도 전혀 문제가 되지 않습니다. 감사합니다.
안녕하세요. 죄송하지만 어디 부분 강의의 코드인지 확인해주시면 찾아보겠습니다. 말씀하신대로 tst에서 인덱스를 지웠다면, 그 변수에서는 인덱스를 다시 불러올 수는 없습니다. 답안제출 시, 인덱스가 필요한 경우에는 별도의 변수에 저장해두어야 합니다. 전체적으로 스크립트를 보았을 때, 그러한 부분이 확인되지 않았는데 조금 더 상세히 질문주시면 확인해보겠습니다. 감사합니다.
안녕하세요. 시험 치르시느라 고생이 많으셨습니다. 통상적으로 별도의 전처리 (변수선택 등)없이 모델을 만들 경우, 최고구간 점수는 아니어도 적당한 점수를 획득할 수 있다고 알고 있습니다. 다만, 평가기준을 공개하고 있지 않기 때문에 점수구간을 알기가 어렵습니다. 커뮤니티를 여러군데 돌아다녀보니, 그 정도의 MAE를 보이는 응시자들이 많은 것 같습니다. 따라서, 어느정도의 점수는 충분히 획득 가능하지만 정확한 점수를 알기가 어렵네요. 부디 결과발표 때, 좋은 소식을 들려주실 수 있으시면 좋겠습니다.
안녕하세요. 저도 동일하게 자료를 다시 다운받아서 R을 켜자마자 메모장의 코드를 실행해보았는데요. train을 불러온 df에서 ' segmentation' 가 정상적으로 로딩됨을 확인했습니다. 아래 그림 참고부탁드리며, 다시 한 번 새로 다운받고 새로 실행해보시면 좋을 것 같습니다. 계속해서 문제 생기면 답글을 부탁드립니다.