안녕하세요 실습하다보니 질문이 생겨서 질문드립니다. 저같은 경우에는 .yml 파일을 올리돼, 중요한 값은 ${변수명} 이런식으로 작성해서 올리는 편입니다. 따라서 이를 EC2 서버의 .bashrc 파일에 export로 설정한 뒤, source ~.bashrc로 값을 초기화해놓았습니다. echo로 확인해보니 문제없이 출력되구요... 그 후 CICD를 적용시켯더니 계속 해당 환경변수를 찾지 못한다는 에러가 발생합니다.. 어떤 부분이 잘못되었는지 모르겠어서 질문드립니다. name: deploy chatGPT server to AWS EC2 on: push: branches: - main jobs: deploy: runs-on: ubuntu-latest steps: - name: ssh로 서버 접근 & git pull 후 재배포 진행 uses: appleboy/ssh-action@v1.0.3 with: host: ${{ secrets.EC2_HOST }} username: ${{ secrets.EC2_USERNAME }} key: ${{ secrets.EC2_PRIVATE_KEY }} script_stop: true script: | source ~/.bashrc cd /home/ubuntu/spring-chatgpt-communication git pull origin main ./gradlew clean build sudo fuser -k -n tcp 8081 || true nohup java -jar build/libs/*SNAPSHOT.jar > ./output.log 2>&1 & 아래는 저의 CICD yml 파일입니다!
위의 에러가 발생하여 질문드립니다. 맨 아래는 제가 작성한 전체 코드 이고, df['subscribed'] = pd.to_datetime(df['subscribed']) 위 코드에서 에러가 발생한 것입니다. from google.colab import drive drive.mount('/content/drive') import pandas as pd import numpy as np df = pd.read_csv('/content/drive/MyDrive/bigdata(빅분기 놀이터)/빅분기 놀이터 Dataset/members.csv') # print(df.head()) df['subscribed'] = pd.to_datetime(df['subscribed']) df['month'] = df['subscribed'].df.month df = df.groupby(df['month']).count() print(df.sort_values('subscribed').index[0])
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 a1 = a[['s1','s2','s3','s4','s5']] sum = a1.sum(axis=1)>0.1 print(sum.sum()) 문제에서 요구한 칼럼을 뽑아서 새로운 데이터 프레임을 만들어서 코딩했습니다. 이렇게 하니 102개가 나왔는데, 어떤 부분에서 문제가 발생하는지 잘 모르겠습니다.
코랩의 노트북 작업시 질문입니다. 노트북에서 한번 따라쳐보고 밑에서 새로 혼자 작성해보는 식으로 해보는데요, 언제부턴가 한번 코드를 치고난 후에는, 코드가 자꾸 자동완성이 되서 치기도 전에 코드가 완성되더라구요.혹시 노트북내에서 자동완성 기능을 끌 수 있는 방법이 있나요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선형회귀분석에서 statsmodel.formula.api.ols와 sklearn.linear_model.LinearRegression의 차이가 궁금합니다. 어떨 때 ols를 쓰고, 어떨때 LinearRegression을 쓰는지 구분이 잘 안돼요.
작업형 2 풀이를 할 때 수치형 데이터들 따로 건들지 않고 id 부분만 삭제하고 object형 데이터들을 단순 삭제 하고 모델 학습 후 검증 데이터로 평가했을때 어느정도 %가 나와야지 채점을 할 때 만점 받을 수 있을까요?단순하게 데이터를 전처리해도 검증 데이터로 평가했을 때 90% 정도가 나온다면 하이퍼파라미터 변경이나 수치형 데이터 스케일링, object형 원핫, 레이블 인코딩을 굳이 할 필요는 없는 것일까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요. 좋은 강의 항상 감사드립니다. 작업형2번 검증데이터 나누기 부분 질문드립니다. 어떤 문제에서는 cols에 범주형 데이터를 제외하고 -> 랜덤포레스트(섹션10 작업형2신유형), 어떤 문제는 labelencoder -> 검증데이터 나누기 -> 모델 학습 및 평가로 이어지는데요. 범주형 데이터가 적을 경우 cols에 범주형 컬럼은 빼고 적은 후 (labelencoder 안하고) 바로 모델 학습을 해도 괜찮은가요?(섹션10 작업형2) 검증데이터 나누기 작업이 들어간 문제들은 어떤 상황이라서 인가요? 꼭 필요한 작업인가요? 감사합니다!
안녕하세요 문의드립니다. 그룹바이 정의값을 df['월평균']으로 넣으면 오류가 나고 df['월평균'] = df.groupby('연도')['총범죄'].sum()/12 df['월평균'] result로 넣으면 오류가 안나는 이유가 뭘까요? result = df.groupby("연도")['총범죄'].sum()/12 result
안녕하세요 일코님 이번에 질문드릴 내용은 선택된 영역의 수식의 String을 변수에 저장하고 싶어서 질문드립니다. 일전에 질문드린 내용에서 hwp.get_selected_pos()를 사용하여 선택된 영역의 위치값을 알 수 있었는데요 이 위치값 안에 위치한 수식의 String을 가져오고 싶어서 문의드립니다. 123과 1/3은 수식으로 입력된 내용입니다. 만약 선택된 내용을 hwp.get_selected_pos()로 받고 math_string = '앞은 문자' + 123 (123은 수식에서 가져온 'String') 이런식으로 변수에 선언해주고 싶다면 어떻게 해야할까요.. (문자와 수식이 혼합된 경우 동일한 순서로 값을 받는 방법이 있을지 궁금합니다.) selected_pos 안에 ctrl을 조회하는게 이전에 설명주신 내용에서는 전체 문서의 ctrl_list의 UserDesc를 조회를 하게되는 방식이였는데 선택된 내부의 ctrl만 조회하게 하는 방법은 없는지도 질문드립니다.
전 강의 분류에서 랜덤포레스트 모델 불러올 때는 model = RandomForestClassifier(random_state=2022) randomstate 값 주었는데 이번 강의에서는 model = LinearRegression() 값을 주지 않았네요. 전 강의에서는 baseline, 원핫 , 라벨 인코딩 등 여러번 비교하면서 평가해야해서 고정시켜준건가요? 이번 강의에서는 라벨인코딩만 사용하기로 해서 굳이 고정시킬 필요 없나요? 또한 이번 강의에서는 단순 object만 제거하는 baseline, 원핫 인코딩 라벨 인코딩 평가 점수를 비교하지 않는데 이유가 있을까요? 또한 랜덤포레스트, 선형회귀 등 여러 모델이 있는데 어떠한 경우에 각 모델을 사용해야 하는지 기준이 있을까요?
# 검증데이터 분리 from sklearn.model_selection import train_test_split X_tr, y_tr, X_val, y_val = train_test_split(train.drop('TravelInsurance', axis=1), train['TravelInsurance'], test_size=0.2, random_state=2002) X_tr.shape, y_tr.shape, X_val.shape, y_val.shape 이렇게 한 이후에 # 랜덤포레스트 from sklearn.ensemble import RandomForestClassifier from sklearn.metrics import accuracy_score model = RandomForestClassifier() model.fit (X_tr, y_tr) (밑에 코드는 생략했습니다) 근데 오류가 model.fit (X_tr, y_tr)에서 난다고 뜹니다. 오류 : Found input variables with inconsistent numbers of samples: [1192, 298] 이렇게 뜹니다,. 뭐가 문제인지 모르겠습니다.
타겟 데이터를 보고 타겟 데이터에 영향을 주지 않을 만한 요소들 (이 강의에서는 name, host_name, host_id, last_review )을 직접 EDA 할 때 보고 정해주면 되는 것인가요? 만약 필요한 데이터를 삭제한다든가 불 필요한 데이터를 남겨뒀을 때 평가 지표가 낮게 나온다면 다시 불필요한 데이터를 선별하는 전처리 작업을 반복하면서 진행하는 것인가요?