탐색적 데이터 분석에서 뭘 캐치해야하는지 모르겠어요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
EDA를 할때 무엇을 알아내서 전처리를 해야하는지 너무 헷갈려요 결측치가 있는지 없는지 보고, 칼럼 갯수확인하고, 트레인과 테스트셋의 카테고리 수 비교 ? 이런것만하면될까요 ㅠㅠ.. 아직 EDA에서 전처리로 연결하는 감을 못잡겠어요..(큰일났어요...)
- python
- 머신러닝
- 빅데이터
- pandas
- 빅데이터분석기사
172만명의 커뮤니티!! 함께 토론해봐요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
EDA를 할때 무엇을 알아내서 전처리를 해야하는지 너무 헷갈려요 결측치가 있는지 없는지 보고, 칼럼 갯수확인하고, 트레인과 테스트셋의 카테고리 수 비교 ? 이런것만하면될까요 ㅠㅠ.. 아직 EDA에서 전처리로 연결하는 감을 못잡겠어요..(큰일났어요...)
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형 2가 드뎌 정리된 듯하면서도 아직 어렵습니다ㅠㅠ
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
C()는 무조건 일원 이원 분산분석에서만 적용되나요? 다중 선형회귀나 앞부분 강의에서는 별도로 C()를 확인하지 못해서요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요! 시험이 코앞으로 다가온 시점에서... 순차적으로 강의를 듣고 있는데 데이터 전처리(결측치/이상치 제거) 이후에 학습모델에 적용하기 위해 수치형 데이터들은 스케일링을, 범주형 데이터들은 인코딩을 해서 train 데이터를 만드는 것으로 이해하였습니다. 그다음 평가(예측)를 위해서 모델에 적용할때 ans = (y_test['income'] != '<=50K').astype(int) 와 같이 타겟값을 바꿔야하는 경우와 평가모델별로 predict, predict_proba 를 사용하는 경우가 정해져 있는건지 이 부분이 헷깔립니다 ㅜㅜ
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 # your code import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p1/members.csv") df.head(3) df = df.sort_values('views',ascending=False).head(10) df r1 = 9690.0 df.iloc[:10,-1] = r1 cond = df['age'] >=80 print(df[cond]['views'].mean()) 안녕하세요 10번째 최소값을 r1= 9690.0 으로 지정 후 df.iloc[:10.-1] = r1로 지정후 결과를 냈더니 9690.0으로 나오는데 왜그런걸까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업3을 위한 원포인트 레슨은 혹시 없을까요? 물론 범위가 광범위하다는 건 알지만, 그래도 혹시:::::
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
print(train.shape, test.shape) train = pd.get_dummies(train) test = pd.get_dummies(test) print(train.shape, test.shape) train = pd.get_dummies(train[cols]) test = pd.get_dummies(test[cols]) 아래처럼 cols로 범주형 칼럼을 인덱싱해서 넣지않고 위처럼해도 되나요? 수치형은 건드리지 않고 범주형에 대해서만 인코딩하기에 cols를 따로 하지 않아도 되나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요, 예시문제 작업형 3번의 2번 문제 풀이에서 질문있습니다! 여기에서 로지스틱회귀 분석을 위해 범주형 변수 중 인코딩이 되지 않은 Gender 변수에 C(Gender)를 붙이셨더라구요 혹시 인코딩되지 않은 변수의 앞에 C를 붙이는 것이 필수로 수행되어야하는것일까요? 제가 궁금해서 C를 붙이지 않고 모델썸머리를 출력하고 값을 비교해봤는데 모든 표값이 같기는 했습니다. 만약, 필수로 C를 붙여주어야한다면 로지스틱회귀분석 뿐만아니라 분산분석(일원/이원)에도 모두 붙여주어야 할까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 헷갈리는 부분이 있어 질문드려요. 회귀분석에서 ols사용시는 ols("종속변수~독립변수1+독립변수2+독립변수3"...) 같은 형태로 사용하고 다중분산분석 ols에서는 ols("종속변수~독립변수1*독립변수2*독립변수3"...) 이렇게 사용해야하는 것이 맞을까요? 회귀분석 : +, 다중분산분석:*
미해결
[신규 개정판] 코딩 입문자를 위한 파이썬 완벽가이드
마우스 자동화 라이브러리 설치 시, 이러한 글이 뜹니다. 어떻게 해결할 수 있을까요?
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
마지막에 result.to_csv("result.csv",index=False) 실행누르고나서 제출만 누르면따로할건없나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
numpy 표준편차랑 pandas표준편차가 다르다고 하셨는데 pandas 표준편차가 시험 표준인걸까요? import를 안하고도 사용할 수 있는 numpy 표준편차가 훨씬 접근하기 편해보이는데 왜 pandas로 쓰라고 하시는지 알 수 잇을까요 ?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
전처리 및 피처엔지니어링 단계에서 범주형 컬럼과 수치형 컬럼을 굳이 4개의 데이터로 나누지 않고 var1 = ['A', 'B', 'C'] (범주형 컬럼 리스트) var2 =['D', 'E', 'F'] (수치형 컬럼 리스트) from sklearn.preprocessing import MinMaxScaler, LabelEncoder col = train.select_dtypes(exclude='O').columns cols = train.select_dtypes(include='O').columns scaler = MinMaxScaler() train[col] = scaler.fit_transform(train[col]) test[col] = scaler.fit_transform(test[col]) # 범주형 변수 인코딩 for i in cols: le =LabelEncoder() train[i] = le.fit_transform(train[i]) test[i] = le.transform(test[i]) 이런식으로 해도 될까요? 추가적으로 수치형 데이터의 스케일링은 필수가 아닌가요?(일부 회차에서 수치형 데이터는 스케일링하지 않아서 여쭤봅니다!)
해결됨
[2026]빅분기 실기! 기출 문제 풀이로 한 방에 합격하기(파이썬)
8회 기출문제 파일(.ipynb)은 github에 있지 않은 거 같은데, 어디서 받을 수 있을까요?
해결됨
실전! Redis 활용
강의를 들으며 공부하다 궁금한 점이 생겨 질문 드립니다. 초반 부분에서 Redis는 RAM에 데이터를 저장한다고 말씀해주셨습니다. 그리고 장바구니 구현 설명에서 set을 활용하여 쉽게 구현하는 방법을 설명해주셨는데 장바구니라는 것이 담기만 하고 실제 구매로 이어지지 않을 수 있어 데이터를 계속 가지고 있어야 할 필요가 있는 반영구적인 기능이라 생각하는데, TTL 설정을 따로 하지 않는 식으로 구현하면 될지 궁금합니다. 또한, 사용자가 늘어나면 늘어날수록 Redis, 즉 RAM에 저장되는 데이터 또한 늘어날 것이라 생각하는데 이와 관련하여 발생할 수 있는 메모리 문제 같은 것은 없는지 궁금합니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
데이터 전처리 강의 내용 중에 X_train 데이터와 X_test 데이터의 결측치를 동일하게 채워주라고 말씀해주셨고, X_train의 행삭제는 가능하지만 X_test의 행삭제는 하면 안된다고 말씀해주셨습니다. 이렇게 되면 X_train에서 결측치가 있다고 행삭제를 해버리면 X_test에서는 결측치가 있는 행이 그대로 남아있을텐데 X_train의 행삭제로 결측치를 해소하는 방법이 어떤 의미가 있는지 이해가 잘 되지 않아 문의드립니다.
미해결
파이썬/장고 웹서비스 개발 완벽 가이드 with 리액트 (장고 4.2 기준)
강의에서 설명하지 않으신 내용인데요 가능한지 궁금하여 여쭈어봅니다. Conda-forge 내에 postgresql package가 있습니다. ( Postgresql | Anaconda.org ) 물론 서비스 시에는 database 서버를 따로 두는게 좋다는건 수업 때 설명으로 이해하였습니다. 그러나 실 서비스 시 postgresql를 사용할 것이라면 개발 시에 sqlite 대신 위 package를 사용하는게 만약 더 적합할까요? 배포 과정 설명 시에 로드 밸런서가 작업을 서버에 할당해준다고 설명해 주셨는데, 보아하니 각 작업을 싱글 쓰레드로 할당하는 것 처럼 보였습니다. 장고의 경우 View 단에 multithread로 작업할 내용이 있다면, 어떻게 처리해야 하나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
2번문제보면 len 말고 sum사용하면 안되나요??
미해결
실전도커: 도커로 나만의 딥러닝 클라우드 컴퓨터 만들기
az vm open-port --resource-group kaggle-linux-gpu_group --name kaggle-linux-gpu --port 3389 Please run 'az login' to setup account. 상기와 같이 az login 을 하라고 하는데 인터넷에서도 해결법을 찾기가 쉽지 않네요. 도움 부탁드립니다
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
표본검정 관련 기출이 없어서 물어봅니다. 혹시,, 정규성이랑, 분산 뭐 이런거 만족한다고했을떄, ttest_1samp, rel, ind 로 풀잖아요,, 근데 정규성이랑 분산만족못하면 비모수 검정까지 하잖아요, 그럼 비모수 검정하고, 다시 ttest 해줘야하는 건가요? 아니면 비모수 검정까지 한 p 값을 적으면 되는 건가요?