먼저 유사한 질문이 있었는지 검색해보세요. 서로 예의를 지키며 존중하는 문화를 만들어가요. 잠깐! 인프런 서비스 운영 관련 문의는 1:1 문의하기를 이용해주세요. 강의에서 도커 설치 이후 실행을 하였더니 위와 같은 화면으로 뜹니다. 또한 말씀주신 turevoly 또한 파워쉘 화면에서 설치가 되지 않고 에러가 뜨는 문제가 발생되네요;; 어찌해야하는지요. ㅠㅠ
안녕하세요 선생님! 시험 전까지 이해안가는 부분은 강의를 다시 들어보면서 복습을 진행하고 싶습니다. 하지만 수강 만료일이 11월6일이라 앞으로 어떻게 공부를 해야할지 모르겠습니다 ㅠㅠ.. 혹시 시험일까지만이라도 수강 기간을 연장할 수 있는 방법은 없는지 문의 드립니다-! 이메일은 maldong97@naver.com 입니다!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님, 쌩초보입니다..너무 기초적인 질문일 수 있는데요,, 문제 1-3 에서는 data = test 라는 과정은 필요 없나요? 1-2 적합한 회귀모형을 사용하랬으니, predict하는 과정만 있으면 된다고 이해하면 될까요 from statsmodels.formula.api import ols model = ols("design ~ c1 + c2 + c4 ", data=test).fit() print(model.summary())
작업형 2 머신러닝 모의2번 문제에서 labelencoder할때, 명령어가 le = LabelEncoder()로 지정하고 아래와 같이 transform할때 fit을 넣고 다음에는 안넣는데, 추측하기로는 train 데이터에서 object 유니크 수를 파악하고 이에 맞는 것으로 변형하기 때문에 fit을 쓴것 같습니다. 그렇다면 trian이랑 test랑 유니크 수가 다르다고 하면 아래와 같이 쓰면 안되지 않나요? 아니면 알아서 잘 수치화가 진행되는걸까요? 일전에 강의에서는 train과 test에서 유니크 수가 다르면, 두 데이터를 상하로 합쳐서 같이 적용하고 나눈다고 들었어서 여쭤봅니다. train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col])
작업형 2유형 문제 궁금한게 있습니다. 수치형 변수 스케일링을 하셨는데, 시험에서도 저 코드를 꼭 써야 하나요? 저거를 임의로 판단을 해서 하는건가요? (마지막에 성능 지표로 확인해서 임의 판단인지) 아니면 시험장에서도 문제에서 명시가 되어있는걸까요? 혹여나, 문제에서 명시 되어 있지 않는데 굳이 저걸 했다가 감점을 받지 않나 해서요 저걸로 가점이 된다면, 항상 모든 문제에 수치형 변수 스케일링을 추가 해줘야 하는거 아닌가요? 왜 문제 마다 수치형 스케일링을 해주는 경우도 있고 아닌 경우도 있고.... 이해가 안갑니다 그리고 RobustScaler를 적용 하셨는데, MinMaxScaler로 해도 되나요? (다른 수치형 스케일링을 써도 되는지 여쭤봅니다) 그리고 하이퍼 파라미터도 문제에 명시 안되어있는데, 저것도 임의 판단해서 쓰는건지 궁금하네요. 시험 문제에는 저렇게 간략하게 나오는건가요? 문제에서 딱.. 하이퍼파라미터 적용.. 수치형 스케일링 적용... 이렇게 나오는게 아닌걸까요?? 너무 추상적이에요... 만약 저렇게 추상적이게 나온다면, 임의로 성능 지표를 확인해가며, 수치형이 있다면 스케일링을 적용해보고, 하이퍼 파라미터가 성능 지표가 높게 나온다면 적용해보고... 이렇게 해야하는건가요? (외람된 질문이지만, 성능 지표가 너무 높게 나와도 안좋은거 아닌가요? 과적합 문제라던지요..)
저는 저 부분을 아래와 같이 for문 안에 if구문으로 처리 하고 싶었는데... if구절에서 i 값을 찍어보면 처음 값만 데이터 그대로 나오고.. 그 담부턴 어뚱한 값이 나오네요.. 뭘 잘못한걸까요? ㅠㅠ mean_2001 = df.iloc[1].mean() print(mean_2001) #print(df.iloc[1]) #cond = df.iloc[1] > mean_2001 #sum(cond) for i in list2001: if i > mean_2001: print(i)
1번 문제 코드를 짜보았는데 결과 값이 조금 다른 것 같아서 질문 드립니다 import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p1/members.csv") df.nlargest(10, 'views') m=df.loc[21,'views'] df.iloc[:10,-1]=m cond=df['age']>=80 df[cond]['views'].mean()
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 빅데이터 왕초보입니다 하지만 선생님 믿고 따라가려고 강의시작하였습니다.. 함수 부문에서 return함수를 쓰는 이유가 정확하게 와닿지 않아서요.. 그냥 뭔가 미지수, a,b~로 도출하는것 같은데.. return함수 쓰는거랑 안쓰는거랑 차이?점이 정확하게 무엇일까요 감사합니다
안녕하세요. 최근 남긴 문의와 같이 현재 데이터 브릭스 커뮤니티 에디션 종료 이슈가 있어 실습을 따라갈 수가 없는 상황입니다. 앞선 문의 내용에선 환불을 말씀해주셨는데 저는 이미 강의자료를 받아서 시스템적으로 환불이 불가한 상황으로 나오는데, 별도로 환불 조치를 해주실 수 있을까요?
import pandas as pd df = pd.read_csv('year.csv') # print(df.head()) df.info() # print(df.shape) df = df.T # print(df.shape) m = df.loc[:,1].mean() # print(m) # 110.18407960199005 sum(df.loc[:,1] > m) 이렇게 풀었는데 결과값이 91이 나오더라구요. 풀이를 보니 year.csv를 불러올 때 index 관련된 내용이 있던데 그걸 사용하지 않으면 loc[2000] 이런 것들을 사용할 수 없게 되는건가요??
loc[2000] 같은 경우에 2000이 숫자형 타입이라 작은 따옴표를 안넣어주는건데 실제 시험에서 그럼 df.dtypes 명령어를 통해서 미리 숫자형인지 문자형인지 파악하고 풀이를 진행하는 방향이 맞는걸까요? 강의 중엔 따로 언급이 없으셔서 질문드립니다!! 항상 감사합니다
생각보다 판다스 이론 공부하는데 머리 속에 쉽게 들어오지 않내요. (파이썬 진도는 다 나감) 지금 제가 판다스 15 내장함수 중인데 그동안에 하나 넘어갈 때 마다 좀 진도는 늦게 나가도 코랩에서 주석을 이용해서 몇번씩 반복을 하면서 나가고 있어요. 이런식으로 해서 과연 끝까지 다 나갈지는 의문이긴 한데 어떤식으로 하는게 좋은지 한번 조언 듣고자 글 올렸어요. 시간 되면 답변 부탁합니다.
list(train.columns[train.dtypes == object]) # 인코딩을 위해 train + test print(train.shape, test.shape) df = pd.concat([train, test]) print(df.shape) << 인코딩과정에서 이 두가지를 꼭 해야할까요 분류형문제에선 이 두가지를 안했었는데 회귀형문제에서는 unique수가 많이 차이나서 한다고 하셨는데 이 두가지 안하고 그냥 그 unique수 많은 컬럼을 삭제한 뒤에 원핫인코딩을 진행하면 안되나요?