안녕하세요 저는 선생님 강의도 듣고, 블로그도 보면서 보통명사 추출하는 함수를 생성해서 tm패키지를 활용해 코퍼스로 변환하는 내용을 공부하고 있습니다~ 커스텀함수는 이렇게 입력하고 words<-function(text){ text<- as.character(text) extractNoun(text) 이후 변환을 하려고 하는데 doc<- TermDocumentMatrix(doc, control = list( tokenize= words removeNumbers =T removePunctuation =T wordlengths= c(3,Inf))) tokenize, removeNumbers, removePunctuation, wordsLengths와 제가 커스텀한 함수(words)가 인식이 안됩니다. ~are ignored 라는 경고가 뜨거나 예상하지 못한 기호(symbol)입니다 라는 에러가 뜹니다.. 해결방법을 알고 계시는지요.
어제 R studio를 여기서 하는데로 최신버전으로 깔았고, 여기서 하라는 데로 그대로 설치를 했습니다. 그리고 여기 강의를 들으면서 따라하던 중.. library(htmltab) 이것을 실행시키면 아래와 같은 문구가 뜨네요.. library(htmltab)에서 다음과 같은 에러가 발생했습니다:‘htmltab’이라고 불리는 패키지가 없습니다. 잠시 install.packages("htmltab")을 실행하지 않아서 그런가 봤더니. 그것도 아니어서... 그래서 더 낮은 32bit버전으로 깔고 해봤는데요... 똑 같습니다.. 그래서 인터넷에 검색해보니.. Package ‘htmltab’ was removed from the CRAN repository. 이렇게 나오네요.. 여기 나와 있는 밑에 답변이 있길래 기쁜마음에 복사해서 붙여놓고 하나하나 실행시켜봤습니다.. setwd("D:\\stock") #library(htmltab) url<-"http://finance.naver.com/item/sise_day.nhn?code=005380&page=1" # 종목 A url<-"http://finance.naver.com/item/sise_day.nhn?code=005930&page=1" # 종목B #install.packages("httr") library(httr) referer <- add_headers(Referer = "http://finance.naver.com/item/sise_day.nhn?code=005380&page=11") #검색해서 들어간 것처럼 위장하기위해 header를 붙여준다 tmp <- GET(url, referer) # GET함수를 통해 해당 서버에 통신을 함 뒤에 referer인자가 위장술 ta<-read_html(tmp)%>% html_nodes(xpath = '/html/body/table[1]') %>% html_table() ta2<-(ta[[1]]) ta2[-c(1,7,8,9,15),] code_data <- read.csv("data.csv",sep="\t") ? read.csv head(code_data) code <- as.character(code_data[,1]) code_name <- as.character(code_data[,2]) re_code <- as.character(sapply(code,function(x){ nc<- 6-nchar(x) paste0(c(rep(0,nc),x),collapse = "") })) k <- 1 i <- 1 for(k in 1:length(re_code)){ final_data<-NULL for(i in 1:10){ url <- paste0("https://finance.naver.com/item/sise_day.nhn?code=",re_code[k],"&page=",i) b <- htmltab(url,encoding="UTF-8") b final_data < -rbind(final_data,b) cat("\n",i) } head(final_data) tail(final_data) dim(final_data) .......... 결과는 몇줄 가지도 못하고 바로 add_headers(Referer = "https://finance.naver.com/item/main.naver?code=005380")에서 다음과 같은 에러가 발생했습니다: 함수 "add_headers"를 찾을 수 없습니다 로 나옵니다.. 이 문제가 반드시 해결이 되야 밑에 코딩한게 전부 의미가 있을 것 같습니다.
한국거래소를 타고서 예전에는 받을 수 있었던 것 같은데, 현재는 http://data.krx.co.kr/contents/MDC/MDI/mdiLoader/index.cmd?menuId=MDC0201020303 이 곳으로 들어가야 종목코드를 다운받을 수 있게 바뀌었네요.. 초보라 한참 찾았습니다. 그리고 강의하시는 제목 "stock R"이 사실은 다운로드 받은 자료의 "naver증권크롤링_예제.R"이네요
이렇게 말씀하시면 이해하기가 어렵습니다. 새로 올려주신 script_v2 그대로도 몇번이나 돌려봤습니다. 강의에서 이렇게 말해주신 파트가 script_v2에서는 이부분 입니다. 일단 이렇게 그대로 따라하면 df_map_join = left_join(df, df_map_id, by = c("ISO_A3" = "iso")) Error in `sf_column %in% names(g)`: ! Join columns in `x` must be present in the data. ✖ Problem with `ISO_A3`. Run `rlang::last_trace()` to see where the error occurred. 이런 에러가 떠서 "ISO_A3"를 -> "iso_a3"로 바꿔주었구요. 이건뭐 상관없고, 불필요한 변수를 미리 제거하라고 하셨는데 >head(df_map_join) Simple feature collection with 6 features and 169 fields Geometry type: MULTIPOLYGON Dimension: XY Bounding box: xmin: -180 ymin: -18.28799 xmax: 180 ymax: 83.23324 Geodetic CRS: WGS 84 featurecla scalerank labelrank sovereignt sov_a3 adm0_dif 1 Admin-0 country 1 6 Fiji FJI 0 2 Admin-0 country 1 3 United Republic of Tanzania TZA 0 3 Admin-0 country 1 7 Western Sahara SAH 0 4 Admin-0 country 1 2 Canada CAN 0 5 Admin-0 country 1 2 United States of America US1 1 level type tlc admin adm0_a3 geou_dif 1 2 Sovereign country 1 Fiji FJI 0 2 2 Sovereign country 1 United Republic of Tanzania TZA 0 3 2 Indeterminate 1 Western Sahara SAH 0 4 2 Sovereign country 1 Canada CAN 0 5 2 Country 1 United States of America USA 0 geounit gu_a3 su_dif subunit su_a3 brk_diff 1 Fiji FJI 0 Fiji FJI 0 2 Tanzania TZA 0 Tanzania TZA 0 3 Western Sahara SAH 0 Western Sahara SAH 1 4 Canada CAN 0 Canada CAN 0 5 United States of America USA 0 United States USA 0 name name_long brk_a3 brk_name brk_group abbrev 1 Fiji Fiji FJI Fiji <NA> Fiji 2 Tanzania Tanzania TZA Tanzania <NA> Tanz. 3 W. Sahara Western Sahara B28 W. Sahara <NA> W. Sah. 4 Canada Canada CAN Canada <NA> Can. 5 United States of America United States USA United States <NA> U.S.A. postal formal_en formal_fr name_ciawf note_adm0 1 FJ Republic of Fiji <NA> Fiji <NA> 2 TZ United Republic of Tanzania <NA> Tanzania <NA> 3 WS Sahrawi Arab Democratic Republic <NA> Western Sahara <NA> 4 CA Canada <NA> Canada <NA> 5 US United States of America <NA> United States <NA> note_brk name_sort name_alt mapcolor7 1 <NA> Fiji <NA> 5 2 <NA> Tanzania <NA> 3 3 Self admin.; Claimed by Morocco Western Sahara <NA> 4 4 <NA> Canada <NA> 6 5 <NA> United States of America <NA> 4 mapcolor8 mapcolor9 mapcolor13 pop_est pop_rank pop_year gdp_md gdp_year 1 1 2 2 889953 11 2019 5496 2019 2 6 2 2 58005463 16 2019 63177 2019 3 7 4 4 603253 11 2017 907 2007 4 6 2 2 37589262 15 2019 1736425 2019 5 5 1 1 328239523 17 2019 21433226 2019 economy income_grp fips_10 iso_a2 iso_a2_eh iso_a3 1 6. Developing region 4. Lower middle income FJ FJ FJ FJI 2 7. Least developed region 5. Low income TZ TZ TZ TZA 3 7. Least developed region 5. Low income WI EH EH ESH 4 1. Developed region: G7 1. High income: OECD CA CA CA CAN 5 1. Developed region: G7 1. High income: OECD US US US USA iso_a3_eh iso_n3 iso_n3_eh un_a3 wb_a2 wb_a3 woe_id woe_id_eh 1 FJI 242 242 242 FJ FJI 23424813 23424813 2 TZA 834 834 834 TZ TZA 23424973 23424973 3 ESH 732 732 732 -99 -99 23424990 23424990 4 CAN 124 124 124 CA CAN 23424775 23424775 5 USA 840 840 840 US USA 23424977 23424977 woe_note adm0_iso adm0_diff adm0_tlc adm0_a3_us adm0_a3_fr 1 Exact WOE match as country FJI <NA> FJI FJI FJI 2 Exact WOE match as country TZA <NA> TZA TZA TZA 3 Exact WOE match as country B28 <NA> B28 SAH MAR 4 Exact WOE match as country CAN <NA> CAN CAN CAN 5 Exact WOE match as country USA <NA> USA USA USA adm0_a3_ru adm0_a3_es adm0_a3_cn adm0_a3_tw adm0_a3_in adm0_a3_np adm0_a3_pk 1 FJI FJI FJI FJI FJI FJI FJI 2 TZA TZA TZA TZA TZA TZA TZA 3 SAH SAH SAH SAH MAR SAH SAH 4 CAN CAN CAN CAN CAN CAN CAN 5 USA USA USA USA USA USA USA adm0_a3_de adm0_a3_gb adm0_a3_br adm0_a3_il adm0_a3_ps adm0_a3_sa adm0_a3_eg 1 FJI FJI FJI FJI FJI FJI FJI 2 TZA TZA TZA TZA TZA TZA TZA 3 SAH SAH SAH SAH MAR MAR SAH 4 CAN CAN CAN CAN CAN CAN CAN 5 USA USA USA USA USA USA USA adm0_a3_ma adm0_a3_pt adm0_a3_ar adm0_a3_jp adm0_a3_ko adm0_a3_vn adm0_a3_tr 1 FJI FJI FJI FJI FJI FJI FJI 2 TZA TZA TZA TZA TZA TZA TZA 3 MAR SAH SAH SAH SAH SAH MAR 이걸 어떻게 제거하나요? 올려주신 script_v2 파일을 다시 재확인 및 수정부탁드립니다. 그리고 위,위에 출력코드 보시면 아시겠지만 바로 위 사진처럼 long lat order hole piece id group 그 어떤것도 찾을수없습니다. 지도가 며칠동안 이것만 붙잡고있는데 진도가 못나가서 너무 답답합니다.ㅏ script_v2랑 올려놓으셨던 강의랑 비교하셔서 수정부탁드립니다. ratio 범례도 , 강의보면서 코드계속 돌려봤습니다. 1 2 3 으로 나옵니다. 강의처럼 0.9 0.8 이렇게 나오질 않습니다.
안녕하세요? date_01 = ymd("2030년 1월 1일") wday(date_01)을 출력하면 3이 나오는 이유를 수업에서 넘어가신 것 같습니다ㅠ 그 이후로 week_start = 1은 월요일을 시작점으로 두는 거고, 보통 week_start는 일요일로 처음에 잡혀있다고 하셨으니, 일요일을 1로 생각하면 화요일이 3으로 나오는 것 추측됩니다만 잘 모르겠습니다ㅠ 만약 제 추측이 맞다면 더 헷갈리는데, week_start = 1이 월요일이니, week_start = 0은 일요일을 뜻하나요? 그럼 0 , 1, 2해서 화요일은 2가 나와야 하지 않나라는 생각도 들어서요...ㅠ
본강의영상에는 마지막에 df_map_join_vac라는 값이 console을 보면 깔끔하고 가독성좋게 데이터시각화되어 표기되는것을 확인할수있습니다. 이번에 새로 올려주신 scrips_v2 파일을 보면서 공부를 하고 있는데요. 세계지도 시각화를 만들기위해 모든과정을 거쳐 마지막에 넣는 값 df_map_join_vac가 무슨 값을 가지고있는지 알아보기가 매우 힘듭니다.
새로 올려주신 파일로 백신데이터 공부중입니다. df_agg = aggregate(data = df[, -5], total ~ ., FUN = "sum") ## 이코드가 무슨 의미인가요? 제가 이해한 내용은 다음과같습니다 "df데이터 중 5번째 항목은 제외한 데이터를 가지고, ( . <-이 전체를 의미하는건가요?그렇다치면) 전체를 기준으로total 변수를 sum(합)합한다." '뭘 어떻게 합한거지(sum)?? 해당코드를 출력해보면 데이터출력에 차이가 생기기는 하는데, 이해하기 어렵습니다.
https://data.seoul.go.kr/dataList/OA-20470/F/1/datasetView.do 서울시 홈페이지에 가도 없는것같습니다. 너무 아쉽습니다 설령 찾더라도 이전과 내용이 너무 많이 달라서 적용이 안되는게 너무 많아서 어렵더라구요. 백신데이터 접종 시각화 강의 마저도 @이 안되길래 r버젼을 다운그레이드하고, rstudio를 재설치해도 안되서 답답하더라구요.. 이번 공공데이터 강의도 현재버젼과 맞지 않은 부분이 있을까봐 걱정됩니다.
안녕하세요? 패키지 불러오기 관해서 여쭤보고 싶습니다. 강의 예시에서, library("data.table")으로 패키지 불러오기를 한 다음, data.table:: 을 하면, library 함수 없이 사용이 가능하다고 하셨습니다. 이 뜻은 library("data.table")을 안 하고 바로 data.table:: ~~ 을 할 수 있다는 뜻인가요?
안녕하세요 선생님, 상세한 강의 잘 듣고 있습니다. 감사합니다. 수강 중, 위의 [섹션4. 2유형] 강의 내용 중 문의사항이 있어 질문을 남깁니다. [동일 내용 문의 링크] 맨 마지막 p3에서 2,482명이 나와야 되는거 아닌가요??? - 인프런 | 질문 & 답변 (inflearn.com) 문의 커뮤니티 내 동일한 질문이 있어 일부 연장선 문의를 드립니다. (체험) 제2유형 - 체험하기 (goorm.io) - 해당문제 model1, model2 을 평균을 내서 최종 모델 p3을 만들고 이를 적용했을 때 최근 답변 기준으로 2482개에서 1611개를 제외한 871개의 행이 출력되는 부분은 이해하였습니다. 연습 중 제출 형식을 보니, 규정에는 총 2482개의 온전한 데이터 예측 결과를 제출해야 한다고 명시되어 있고 이를 강의 상의 871개짜리 데이터로 최종 제출해도 채점 기준에 부합하는지 궁금합니다. 저는 TEST 파일은 열 생략이나 결측지 보정 들의 수정이 가해지면 안되는 원본 데이터의 상태 로 예측 모델을 적용하는 것으로 인지하고 있는데, 해당 부분에 대한 보충 회신을 주시면 감사드리겠습니다. (채점을 위한 기관측의 추가 별도 데이터를 대입하여 예측결과가 실제로 산출되는지 확인하는 부분이 있다하여, 모든 독립변수 행에 대해서도 대응할 수 있는 모델에 대해서 추가 설명이 있으면 도움이 될 것 같습니다.) 제가 강의 내용 중 못 따라간 부분이 있을 수도 있어, 코드 작성 내 놓친 부분이 있는지 계속 수강내용과 확인해 보겠습니다. 감사합니다.
강의자료 다운로드 어디서 받나요? 강의 코드 홈페이지에는 https://www.theissaclee.com/ko/courses/rstat101/ 이곳이라고 안내가 나와있는데.... 이런 사이트로 접속이 되는데;;; 제가 못찾는건지.. 잘못 업데이트가 된건지... 알려주실 수 있을까요 ㅜ ㅜ ?
rstudio, rtools, r 다운로드까지는 잘 따라했는데 Rstudio 테마 적용하기부터 잘 안되고 있습니다. rscode.io 설치하기 따라했는데도 검정 배경이나 글꼴이 적용이 안되고, rscodeio::install_theme() 작성하면 아래와 같이 뜹니다! get_stylesheets_location()에서 다음과 같은 에러가 발생했습니다: Could not find location of your RStudio installation. 어떤 점이 문제일까요...?