학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 (sklearn.metrics) 이 패키지에 RMSE, RMSLE, MAPE 등 다 추가 됐다고 말씀하셨던 것 같은데 작업형2 모의문제2 에서는 직접 수식을 계산해야 한다고하셔서 혹시 어떤게 맞는건가요? 패키지에 추가 됐긴했는데 시험장에선 업데이트가 안됐다고 이해하면 될까요??
다중분류 평가지표(f1_score) 에서 문자인 경우 pos_label = ' ' 을 적용해서 검증 자료에 대해 평가 결과를 확인하는데, 이후 test 자료를 저장할때는 문제에서 요구하는 히나의 값을 (A,B,C 중에서 B선택) 고르는게 아니라 pred로 왜 저장해야 하는지 긍금합니다~! 다중분류 평가지표(roc_auc) 에서 0,1,2 중에서 2를 선택해야 할 경우 pred_prob( , pred[ : ,2] ) 이렇게 2를 적용해야 되는것이 맞는지 문의드립니다~!
작업형1 모의문제3 문제7 [질문1] 풀이과정에서 2001행의 평균 조건을 cond로 사용하고 2003행의 평균 조건도 cond로 사용하셨는데, 왜 cond1, cond2 구분이 없어도 각각의 값이 출력이 되는건가용!?ㅠㅠ [질문2] df.head() df=df.T df.head() print('2001 평균:', df[2001].mean()) print('2003 평균:', df[2003].mean()) print('A :', sum(df[2001]>df[2001].mean())) print('B :', sum(df[2003]<df[2003].mean())) print('A+B :', sum(df[2001]>df[2001].mean()) + sum(df[2003]<df[2003].mean())) 혼자 먼저 풀어보는 과정을 해봤는데요 이전에 행/열 트랜스폼 하는 거 알려주셔서~! df.T로, 행/열 트랜스폼하구 mean()으로, 각 열(컬럼)에 대해 평균 구하고 sum으로, 크거나 작은 수의 개수를 구했는데.. 2001 평균: 100.735 2003 평균: 97.215 A : 100 B : 102 A+B : 202 요렇게 나왔어요.. loc로 풀은 내용과 왜 다를까요?ㅠ 꼭 loc써야 하는 문제였을까요?!ㅠㅠ
EDA 과정 중에 # 기초통계 train(object) train.describe(include='O') # 기초통계 test(object) test.describe(include='O') train과 test 데이터의 unique 값이 동일하다면 실제 카테고리 값 자체 비교 없이 바로 인코딩 해도 문제 없나요? 카테고리 값을 비교해서 안전하게 하고 싶지만, 굳이 안 그래도 되는 거면 안 하려고 합니다!!
[리뉴얼] 파이썬입문과 크롤링기초 부트캠프 [파이썬, 웹, 데이터 이해 기본까지] (업데이트)
안녕하십니까. 강의 잘 듣고 있습니다. 다름이 아니라 선생님의 풀이와 제 풀이의 답은 같으나 과정에서 약간의 차이가 있어 질문 드립니다. 우선 예제 2번의 경우 저는 import requests from bs4 import BeautifulSoup res=requests.get(' https://davelee-fun.github.io/ ') soup=BeautifulSoup(res.content, 'html.parser') items= soup.select _one('h1.sitetitle') print(items.get_text()) 이러한 풀이 방식을 썼습니다. 의도를 표현해보자면 'Teddy의 선물 블로그' 라는 단일 데이터 를 뽑아낼 것이므로 'select'가 아닌 특정 포인트만 뽑아 주는 'select_one'을 사용 했으며, 역시나 단일 데이터를 뽑아낼 것이므로 굳이 반복문인 'for ~ in ~'을 쓰지 않고 'print'만을 사용 했습니다. 이러한 저의 접근 방식이 오류가 없는지 궁금합니다. 아래의 풀이는 선생님께서 해주신 풀이 입니다. import requests from bs4 import BeautifulSoup url = ' https://davelee-fun.github.io/ ' res = requests.get(url) soup = BeautifulSoup(res.content, 'html.parser') items = soup.select ('h1.sitetitle') for item in items: print (item.get_text().strip()) 예제 4번 질문 입니다. 4번의 경우 저의 풀이는 import requests from bs4 import BeautifulSoup res=requests.get(' https://davelee-fun.github.io/ ') soup=BeautifulSoup(res.content, 'html.parser') items= soup.select ('section.featured-posts h4.card-text') for item in items: print(item.get_text().strip()) 이러한 풀이 방식을 썼습니다. 그 의도는 items= soup.select ('section.featured-posts h4.card-text')에서 보면 section 이라는 태그의 .featured-posts 이라는 클래스명 산하의 h4 이라는 태그의 .card-text 클래스명을 가진 것들의 데이터를 추출하고 싶다는 뜻 이였습니다. 저는 이것을 'section.featured-posts h4.card-text' 이라는 방식으로 띄워쓰기 를 이용하여 한 번에 표현해도 문제 없을 것이라고 판단했으나 선생님의 풀이를 보았을 때 import requests from bs4 import BeautifulSoup url = ' https://davelee-fun.github.io/ ' res = requests.get(url) soup = BeautifulSoup(res.content, 'html.parser') box = soup.select _one('section.featured-posts') items = box.select ('h4.card-text') for item in items: print (item.get_text().strip()) 라는 방식으로 어떻게 보면 두 번으로 나누어 표현했음을 이해했습니다. 단순 방식의 차이인지 제가 틀리게 표현 했는데 우연히 맞은 것인지 알고 싶습니다. 마지막으로 6번 예제 질문입니다. 6번의 경우 저의 풀이는 import requests from bs4 import BeautifulSoup res=requests.get(' https://davelee-fun.github.io/ ') soup=BeautifulSoup(res.content, 'html.parser') items= soup.select ('div.container.text-center > span') print(items.get_text().strip()) 이러합니다. 의도를 설명하지면 div 이라는 태그의 .container 와 .text-center 이라는 두 개의 클래스명을 지닌 것 바로 아래의 > span 라는 태그 내의 데이터를 추출하고 싶다는 의미였습니다. 이렇게 하면 'Never miss a story from us, subscribe to our newsletter' 라는 내용을 뽑아 낼 수 있을 것으로 보았으며, 'Never miss a story from us, subscribe to our newsletter' 라는 단일 데이터를 추출 하는 것이니 'select'를 썼더라도 굳이 반복문인 'for ~ in ~'을 사용하지 않아도 될 것 이라고 생각했지만 'AttributeError: ResultSet object has no attribute 'get_text'. You're probably treating a list of elements like a single element. Did you call find_all() when you meant to call find()?' 라는 오류가 떴습니다. 그래서 items= soup.select ('div.container.text-center > span') for item in items: print(item.get_text().strip()) 또는 items= soup.select _one('div.container.text-center > span') print(items.get_text().strip()) 라고 바꾸어 써보니 제대로 된 답이 출력 되었습니다. 저의 첫 오답의 경우 items= soup.select ('div.container.text-center > span') print(items.get_text().strip()) 이 구문은 items가 list 형식이며, 그래서 for 반복문을 사용하지 않고는 get_text()를 사용할 수 없다는 ai의 답변을 받았지만 뭔가 알듯 말 듯한 느낌이라 다시 설명을 듣고 싶습니다. 그리고 제대로 된 답이 도출 된 위 두 개의 경우의 차이를 알고 싶습니다. 긴 글 읽어주셔서 감사합니다. 좋은 하루 보내세요.^^
가설검정의 독립표본 검정과 카이제곱 적합도 검정을 서로 대체하여 사용할 수 있는지 문의드립니다! 독립표본도 서로 다른 2개의 집단 (표본)의 차이를 확인하는 것 처럼 카이제곱 적합도 또한 서로 다른 2개의 집단 (관측, 기대치)의 차이를 구하게 되는데, 그럼 이때 서로 대체하여 쓸 수 있는지 해서 여쭤봅니다! (물론 카이제곱 적합도 예제에서 독립표본 구하는 맨휘트니를 적용하니깐 값이 다르게 나오긴 합니다...^^)
Elastic Cloud 에서 "Logs and metrics" 기능 활성화를 통해 나중에 문제 발생시 로그 및 매트릭 확인을 위해서 해당 기능을 활성화 하고자 하는데요. 이 기능은 좋은데 문제점이 너무 빠르게 용량을 잡아 먹는다는 것 입니다. 저 예산으로 가야 되는 상황이라 어쩔 수 없이 낮은 사양으로 할 수 밖에 없는 상황이지만 그렇다고 "Logs and metrics" 기능을 비활성화 하기에 나중에 문제 발생시 대처가 안 될 것 같아서 고민이 됩니다. 한번 여러 방면으로 대책법을 찾아보니 필수 로그 및 메트릭만 수집 (필터링) 수집 주기 조정 (Metrics 기준) 이렇게 대응 방법을 말해주고 있는데요. 지금부터 ChatGPT 가 답변해준 글을 공유 하도록 하겠습니다. ================================================== 💥 주요 성능 부하 원인 🔁 수집량 과다 수집 주기 짧음, 많은 필드 → 데이터 폭주 📥 Ingest Pipeline 부하 Elastic Agent가 사용하는 Ingest Pipeline이 CPU/RAM 자원 소비 💾 인덱싱 부하 많은 로그가 빠르게 들어오며 디스크 I/O 및 CPU 부하 증가 🔍 자동 매핑 확장 필드가 자동으로 확장되어 메모리, 클러스터 상태 불안정 🧠 ILM 미적용 / 장기 보존 오래된 데이터가 계속 쌓이며 성능 하락 및 디스크 압박 ✅ 해결책: 성능 최적화 전략 1. 필수 로그 및 메트릭만 수집 (필터링) 수집 대상 최소화: log.level: error , source: app-* 등 필요 데이터만 수집 예: Elastic Agent policy에서 수집 대상 제외 설정 processors: - drop_event: when: not: equals: log.level: "error" 2. 수집 주기 조정 (Metrics 기준) 리소스기본 주기추천 조정Metrics (System, Docker 등)10s~15s→ 30s~60s로 늘리기 Elastic Agent 정책에서 조정 가능 (Kibana → Fleet → Integration Policy → Advanced options) 3. ILM 수명주기 정책 설정 오래된 로그/메트릭 자동 삭제 또는 cold/warm tier로 이동 예: logs-* , metrics-* 인덱스 7일 후 삭제 📍 Elastic Agent Policy 설정 페이지 찾는 방법 🔹 경로: Kibana에 로그인 왼쪽 메뉴에서 "Management" → "Fleet" 클릭 → Fleet 은 Elastic Agent를 중앙에서 관리하는 UI입니다. 상단 탭에서 "Agents" 또는 "Agent policies" 클릭 원하는 정책 이름 클릭 (예: Agent policy 1 ) Integrations 리스트 가 보이면, 로그/메트릭 관련 항목 클릭 (예: System , NGINX , Kubernetes 등) Advanced Options 또는 Streams 탭에서 수집 조건/필터 조정 가능 🎯 필수 로그/메트릭만 수집하는 핵심 위치 Integrations 안의 Stream 설정 예: system.syslog → enabled ✅ / ❌ 메트릭 → 수집 주기(Collect every 10s 등) Advanced YAML (고급 설정) 예를 들어, error 레벨만 수집하도록 필터 추가: processors: - drop_event: when: not: equals: log.level: "error" 🧭 화면 예시 흐름 Kibana └─ Management └─ Fleet ├─ Agent Policies ← 여기서 정책 선택 │ └─ [Agent policy 1] │ └─ System integration 등 클릭 │ └─ Streams or Advanced options 설정 ================================================== 이렇게 필수로그 수집 기능 및 수집 주기 조정 기능으로 조금이나마 성능 부하를 줄이고자 할려고 하는데요. 말 그래도 키바나 접속 해서 Fleet 페이지로 가서 먼저 agent policy 등록를 하고 등록한 agent policy 접근 해서 system-1 클릭하면 Edit System integration 페이지 접근 할텐데요. 여기서 Collect metrics from System instances 에서 Change defaults 클릭 하고 여기서 원하는 Period 를 설정 하면 되는게 맞는 것인지 궁금 합니다... 혹시 또 추가적으로 설정 해야 하는 부분이 있을까요?
기존에 mymonitoring이라고 해서 cpu//memory 대시보드 만든건 쿼리에 메트릭조회가 잘 됩니다.거기에서 보면 DataSource 부분에 mixed가 선택되어있고 밑에 A, B 쿼리에서 ${datasource}가 선택되어있는데 ...저 mixed선택부분에 밑에 여러개 리스트가 보이던데 원래 mixed그대로 두는게 맞는지..저기에 보이는거랑 밑에 A,B에서 선택하는거랑 무슨차이가 있는지요? 왜 여쭤보냐면 nginx-controller 강사님 하신대로 대시보드 복사해서 왔는데 거기에는 A,B,C에는 Datasource 이미 prometheus가 선택되어있고 A,B,C에는 선택이아니라 그냥 이름만 표시되어있어서요..어떻게 하는게 맞는건지 헷갈립니다. ${datasource} 그리고 그랸 Prometheus 이거 차이는뭔지 헷갈립니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 다름이 아니라 작업형 1, 3번은 답변을 적는 페이지가 따로 있는데 코드 적는 풀이도 채점을 받게 되는 건가요? 강의에서 보면 중간 print들은 지워주라는 말씀을 몇 번 하셨는데 꼭 답변 부분만 print로 출력해야 하는지, 중간 과정은 출력하면 안되는지, 또 혹시라도 답변 부분을 print로 확인 후 주석 처리 시 감점 요인인지 궁금합니다. 저는 제출한 답안만 평가 대상이라고 생각했는데 저의 풀이과정 코드도 평가 대상일까요??