문제8, 문제9 풀이에서 numeric_only=True 옵션에 대해서 궁금해서 질문해요 문제 8번 풀이에서df =df.groupby(['city','f2']).sum(numeric_only=True).reset_index() df =df.groupby(['city','f2']).sum(numeric_only=True).reset_index() 에서는 컬럼 'city' 와 'f2' 컬럼이 수치형 자료라 numeric_only=True 를 설정해야 하는 건가요!? 문제 9번 풀이에서 groupby 로 월 별 데이터 개수를 구할 때는 count(numeric_only=True) 로 설정하면 오류나는 이유는 뭔가용..??? month 가 숫자형이어서 그런가요 아니면 count 가 설정할 필요가 없어서인가요 ? ㅠ.ㅠ numeric_only=True 를 어느 때 써야하고 안 써야하는지 구분하는게 정확히 어떤 기준인지 궁금합니다
#train['환불금액']=train['환불금액'].drop #test['환불금액']=test['환불금액'].drop train=pd.get_dummies(train) test=pd.get_dummies(test) target=train.pop('성별') from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train,target,test_size=0.2,random_state=0) from sklearn.ensemble import RandomForestClassifier model=RandomForestClassifier(random_state=0) model.fit (X_tr,y_tr) pred=model.predict(test) submit=pd.DataFrame({'pred':pred}) submit.to _csv('result.csv',index=False) a= pd.read _csv('result.csv') print(a.head()) 위와 같이 한가지방법으로 풀기와 동일하게 진행하였는데 model.fit (X_tr,y_tr) 에서 오류가 납니다. 결측치가 있는 '환불금액'열을 삭제해도 동일한데 한가지방법으로 푸는 코드에 오류나 잘못된 부분이 있을가요?.
한글 자동화 관련해서 공부할 강의 분량이 너무 많아서 완강은 아직 엄두도 안나고, 그냥 쭉 한 번씩 구경(?)하던 중이었는데요. 13-2. 녹화된 스크립트매크로를 파이썬에서 활용하는 방법 이 강의에서는 내용이 전혀 뜨지 않네요. (아래 캡처) 제 컴퓨터 환경에 문제가 있는 것일까요?
안녕하세요, 강의와 교재로 공부하고 있습니다. 교재 작업형2 ch4 회귀 부분에서 트레인 테스트 데이터를 합친 후 범주형 데이터를 레이블 인코딩 한 후 다시 트레인 테스트로 쪼개고 결측치를 채우는 최솟값, 최빈값으로 채우는 과정으로 진행이 되는데요, 레이블 인코딩 과정에서 범주형데이터의 결측치가 하나의 값으로 인코딩이 되어서 결측치가 존재하지 않아 중앙값으로 결측치를 대체하는 과정이 불필요한 것 같은데 맞을까요? 또한 원핫 인코딩을 사용하려는 경우 결측치를 먼저 대체한 후에 인코딩을 해야 오류가 안나는게 맞을까요? 일반적으로 결측치 처리를 인코딩 후에 하는지 전에 하는지 궁금합니다. 감사합니다.
작업형2 모델 분석 및 결과 제출에 대해 질문이 있습니다. 회귀분석을 예로들면 랜덤포레스트회귀, XGB회귀, 릿지, 라쏘 등 다양한 모델을 사용해서 모델 마다 도출하는 값이 다른고 그 중 가장 높은 값(r2값이나 mse 값 등 문제에서 평가로 제시된 지표)을 사용한다고 알고 있습니다. val데이터로 학습을하고 가장 높은 값을 찾아서 마지막에 pred = model.predict(test)로 대입하는데, 모델을 선택하는 과정이 없는 것 같습니다. 이렇게 두개의 모델을 사용해서 각각 값을 도출해서 위와 같은 값이 나왔고 이런식으로 test데이터를 예측값에 적용하는데 위 두개에 모델중에 더 나은 모델을 선택하는 과정이 없는건가요?? 두개의 모델이 다 활성화 되어있는데 저렇게 밑에 model.predict만 적어놓으면 이 모델이 xgb인지 랜덤포레스트인지 어떻게 인식하는걸까요?
안녕하세요! 엔티티 -> DTO, DTO -> 엔티티 변환 모두 STRICT 전략을 사용하는 modelMapper.map을 사용하고있습니다. DTO를 쓰는 이유 -> 엔티티가 바뀌어도, dto는 그대로이므로 api 스펙이 바뀌지않음. 그런데 STRICT 전략을 쓰는 modelMapper를 사용하면, dto와 엔티티 필드이름이 정확하게 일치해야하므로 엔티티가 바뀌면 dto 필드도 바뀌어야함. 이렇게 되면 엔티티 변경 시에 api 스펙이 바뀌지않는다는 장점이 없어지게됨 이런 생각이 들었는데, 그럼 STRICT 전략은 지양해야하나요, 아님 다른 방법이 있는 것인가요?
모의고사 문제 3번 풀이 관해서 질문 드려요! 문제 3번 풀이가 방법이 총 세가지로 풀이 해주셨는데 ( replace, map, 조건) 혹시 시험에서 저런 류의 문제에서 결측치랑 데이터값을 변경하라는 문제에서 어떤 특정한 풀이를 이용해서 풀라고도 나오기도 하나요? 아니면 저 세개중에 한가지 방법만 사용해서 답만 구해도 상관 없는건가요!?
안녕하세요. 좋은 강의 항상 감사합니다. JPA 와 디비를 배우면서 적용 하는 과정에서 궁금한게 생겼습니다. @Transactional public Post getPostDetail(Long postId) { Post post = postRepository.findById(postId) .orElseThrow(() -> new CustomException(ErrorCode.POST_NOT_FOUND)); post.incrementViewCount(); // 조회수 증가 return post; } 상세글 조회 시 조회수가 +1 되는 간단한 로직을 가정하겠습니다. 트래픽이 크다고 가정 할 시 해당 로직 대로 하면 조회 시 마다 DB에 부하가 예상되서 질문 드립니다. 해당 로직대로 해도 DB에 크게 부하를 주지 않는 수준인가요? Redis를 써서 조회수 만 따로 캐시로 저장을 한다면 DB랑 데이터가 정합하지 않을 것으로 예상됩니다. 만약 조회수가 중요한 서비스라면 db 락을 이용하여 성 능 저하를 감안 하고 하시는지.. 실무에선 어떻게 처리하시는 지 궁금합니다
Assistant 기능으로 데이터를 tagging 하는 봇을 만들려고 합니다. tagging에 관한 정보를 file에 업로드 하고 필요한 내용을 bot을 통해 묻고 답으로 tag list를 받아 보려고 하는데요, 이 때 file로 질문 마다 새로운 thtread를 만들어서 질문을 하게 되면 file을 확인할때는 매번 token을 사용한걸로 처리가 되고 비용이 청구 될까요? 이런 목적으로 하는 경우에는 file 보다는 fine-turing이 더 좋을까요?
from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train.drop('charges',axis=1), train['charges'], test_size=0.15, random_state = 2022) X_tr.shape, X_val.shape, y_tr.shape, y_val.shape 학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 먼저 선생님의 코드는 위와 같았습니다. 아래는 제가 수정해서 작성한 코드입니다. from sklearn.model_selection import train_test_split X_train = train.drop('charges', axis = 1) y_train = train['charges'] X_tr, X_val, y_tr, y_var = train_test_split(X_train, y_train, test_size = 0.15, random_state= 2002) -------> 보기 편하려고 이렇게 넣었더니 y_var을 찾을 수 없다는 에러가 나왔음 헷갈리지 않기 위해 이와 같이 변수로 처리한 뒤 train_test_split을 했더니 X_train.head를 찍어도 선생님과 다른 결과가 나오고 평가 수식을 적은 후 linear regression을 하니 y_val이 정의되지 않았다고 에러가 나옵니다. 이유가 무엇인지 한참 고민해도 알아내지 못해서 질문 남깁니다. 답변해 주시면 감사하겠습니다.
학습하는 분들께 도움이 되고, 더 좋은 답변을 드릴 수 있도록 질문전에 다음을 꼭 확인해주세요. 1. 강의 내용과 관련된 질문을 남겨주세요. 2. 인프런의 질문 게시판과 자주 하는 질문(링크)을 먼저 확인해주세요. (자주 하는 질문 링크: https://bit.ly/3fX6ygx) 3. 질문 잘하기 메뉴얼(링크)을 먼저 읽어주세요. (질문 잘하기 메뉴얼 링크: https://bit.ly/2UfeqCG) 질문 시에는 위 내용은 삭제하고 다음 내용을 남겨주세요. ========================================= [질문 템플릿] 1. 강의 내용과 관련된 질문인가요? (예/아니오) 2. 인프런의 질문 게시판과 자주 하는 질문에 없는 내용인가요? (예/아니오) 3. 질문 잘하기 메뉴얼을 읽어보셨나요? (예/아니오) [질문 내용] 연관관계의 주인은 일반적으로 외래키가 있는 쪽에 설정하는 것이 좋다고 알고 있습니다. 강의자료에서 "일대다 단방향 관계에서는 1 쪽이 연관관계의 주인이 된다." 라는 것은 "항상" 참인건가요? 아니면 강의의 2:11 처럼 Member 가 Team 을 참조할 일이 없는 특수한 경우에는 "1쪽을 연관관계의 주인으로 둘 수도 있다" 라는 것인가요? 만약, Member 엔티티에서 Team 을 참조하는 일대다 양방향인 상황이 생긴다면, "여전히 1쪽을 연관관계의 주인으로 둘 수도 있지만, 장단점을 고려했을때 다쪽을 연관관계의 주인으로 두는 다대일 양방향을 사용하는 것이 좋다 " 라고 이해하였는데 맞는 말일까요?