안녕하세요. "실무로 배우는 빅데이터 기술" 교재와 15일간의 빅데이터 파일럿 프로젝트 강의에 열정을 쏟고 있는 학생입니다. 커뮤니티 게시판에 '고민있어요' 배너를 보고, 제 학습과 관련된 고민을 나누고자 글을 쓰게 되었습니다. 제 경험을 간단히 소개하자면, 약 2년간 직장에서 파이썬을 활용하여 크롤링, 분산 처리, API, DB 관리 등을 통해 데이터 수집 및 모델링 업무를 해왔습니다. 이후 데이터 엔지니어로 전환하면서, 본격적으로 이 분야를 공부하기 시작했습니다. Hadoop 생태계나 리눅스는 이전에는 이름만 들어본 적이 있었는데, 이번 강의를 통해 직접 프레임워크를 구축하고 설정하며, 데이터를 쌓아보는 경험은 정말 뜻깊습니다. 특히 Cloudera나 Git에서 'bigdata2nd-master' tar 파일을 받아 시스템을 구축하는 과정을 통해 전체적인 워크플로우와 업무에 대한 이해를 넓힐 수 있었던 점은 다른 어떤 강의보다 만족스러웠습니다. 처음 프레임워크를 하나하나 구축하고 설정하는 과정이 매우 어렵게 느껴졌는데, 이번 강의를 통해 크게 성장할 수 있었습니다. 강의 중 강사님께서는 프레임워크 자체에 집착하기보다는, 요구사항을 통해 세부적인 요구사항을 도출하고, 이를 해결하는 방법에 중점을 두라는 조언을 주셨습니다. 프레임워크가 어떻게 활용되는지를 이해하고, 실제 문제 해결에 적용하는 방향으로 학습하라는 조언은 매우 감사했습니다. 하지만, 저의 고민은 여기서 시작됩니다. 저만의 공부와 업무를 진행할 때, 대부분의 경우 도커 컨테이너 내에서 conf, yaml, Dockerfile 등을 직접 구성하거나 수정해야 할 것으로 압니다. Cloudera를 사용하지 않고 직접 프레임워크를 설계하며 공부를 해보고 싶은데, 이에 관련된 다른 강의나 학습 방향에 대한 조언을 구할 수 있을까요? 긴 글 읽어주셔서 감사합니다.
[실전]텍스톰 TEXTOM 실전 강의: 빅데이터 논문 작성을 위한 텍스트 분석/텍스트마이닝
N-gram 분석은 N개 단어의 연쇄를 확률적인 수치를 산출하고 시각화하는 방법으로 대용량의 문서에서 특정 단어 뒤에 위치하는 단어나 음절의 빈도를 정량적인 수치로 나타낼 수 있다(Kang & Lee, 20019). 단어 간 연결방향이 화살표를 통해 시각화되며 화살표의 굵기 크기를 통해 연결강도가 결정된다(Yoo et al., 2019). 또한 연관 단어 간 관계성을 분석하면 단어간 관계 파악에 용이다하다(Kim, 2020). 본 연구에서는 Textom에서 제공하는 N-gram 텍스트마이닝 기법 시 데이터의 흐름과 이해를 하기 위해 가장 먼저 기초 분석 자료로 활용되는 기법이기도 하다. 단어빈도에 기반한 분석은 전체 문서 내에서 특정 단어의 풀현 빈도를 나타낸다. 문서 내에 특정 단어가 등장하는 횟수를 나타내며 이수치값이 클수록 문서에서 자주 사용하는 단어임을 의미한다(Jang et al.,2018). 높은 출현 빈도를 나타내는 단어는 대체로 연구주제와 관련된 함축된 의미를 내재하고 핵심 단어로 작용 할 수도 있다(Lee,2022).
함수에 대해 정의내릴 때 예를 들어 코랩 에서는 scaler = minmax_scale() 이렇게 정의를 내리고 scaler(data) 하는데 #코랩은 정의내릴 때 괄호를 빼면 동작안함 구름에서 테스트해보니까 scaler = minmax_scale()하고 scaler(data)하면 에러가 발생하고 괄호없이 scaler = minmax_scale 만해야 에러가 발생하지 않더라구요. 이게 구름 환경만의 특성이라서 그렇다고 보면 될까요?
쉽게 처음하는 파이썬 고급 크롤링 [Scrapy, Selenium, Headless Chrome]
안녕하세요 저는 비전공자이고 풀스택 전과정 + 고급 크롤링 강의를 듣고있는 수강생입니다. 우선 너무 좋은 강의 정말 잘 듣고 있습니다. 저는 코딩을 아예처음 접하고있어서 어느쪽으로 가고싶은지 전혀 갈피가 없었는데요. 하다보니 데이터과학이 제가 하고싶었던 분야라는것을 알게되었습니다. 항상 외주로 개발자를 구해서 돈을 주고 프로그램을 제작하는것을 자주해왔는데요. 개발비로도 2000만원이상을 쓴것 같습니다. 그런데 제가직접 해보고자 이곳을 찾아왔고, 데이터 과학이 제가 생각한 분야라는것을 고급크롤링 강의들으면서 알게되었습니다. 그런데 궁금한점은 개발자에게 외주를 맡기면서 항상 GUI 방식의 프로그램을 받아서 그것으로 크롤링 및 자동화 프로그램들을 주로 외주를 맡겨왔었는데요. 강의 내용을 계속보고있는데 GUI 에 관한건 없더라구요. 제가 못찾는건지 별도 다른강의가 있는건지 알고싶습니다. 저는 GUI에 자동화 소스를 버튼처럼만드는 그런 프로그램을 만들고 싶거든요 ! 강의내용의 질문은 아니지만, 그 강의가있다면 추가로 구매해서 수강하고싶습니다. 답변 부탁드립니다
selenium 실력 업그레이드 ② - 네이버 지도 크롤링/검색어 입력구현 이곳 수업은 아마 혼자했다면 포기했었을 것 같습니다. 아무리해도 search = browser.find_element(By.CSS_SELECTOR, 'input.input_search') 이것부터 인식을 안해서 왜 안되나 찾고 찾아도 알 수가 없었습니다. time어쩌고 언급이 된 것 같았지만 그것을 읽을 때는 심각하게 생각하지 않고 지나쳐 버려서... 포기하고 수업을 들으니 특별한 것이 있을 줄 알았는데... # 검색창 찾아서 입력 search = browser.find_element(By.CSS_SELECTOR, 'input.input_search') search.click() time.sleep(1) # 이것을 안해줘서 인식을 못했음, 사람처럼 인식하도록 함 search.send_keys("강남역 맛집") time.sleep(1) search.send_keys(Keys.ENTER) time.sleep(2) # 3개의 명령어가 순식간에 일어나면 네이버지도는 사람이 아니다라고 인식 별것 아닌 것 같은 time.sleep(1) 이것이 해결책이었네요. 이 수업하나로 수업료낸 값어치가 있는 것 같습니다. .
안녕하세요. 다름 아니라 Spring Boot가 3.XX 버전으로 업데이트가 되면서, 해당 버전을 사용하시는 분들은 1.3.176버전으로 H2 이용 시 404에러가 발생합니다. 해당 에러를 해결하려면 최신 버전으로 H2를 사용하여야 하는데요. 최신 버전으로 H2를 사용하면 1.3.176 이하 버전처럼 db가 자동 생성 되지 않습니다. 그래서 해결 방법을 찾았는데요. 이 방법은 제가 어떻게 어떻게 하다 보니 발견한 방법이라서 옳다고 할 수는 없겠지만, H2를 테스트용으로만 사용하기 때문에 띄우기만 하면 되므로 문제 없을 것 같아 공유드립니다. 우선 pom.xml에서 h2 dependency를 추가하였다면, 아래 이미지처럼 왼쪽 프로젝트 창의 External Libraries 리스트에서 h2를 찾을 수 있습니다. 해당 h2 jar파일을 우클릭하면 탭이 뜨는데 Open Library Settings(F4)를 선택하면 h2 jar 파일의 위치를 확인할 수 있습니다. 그럼 해당 위치로 가셔서 jar파일을 더블 클릭하여 실행시키면 브라우저에서 H2 콘솔이 실행됩니다. (h2 jar 파일 우클릭 시 탭에서 Open in > Directory Path(Ctrl + Alt + F12)를 선택하면 Show Explorer탭이 뜨고, jar 파일 선택하면 폴더로 바로 이동 됩니다) 이 때 우측 하단의 트레이를 확인해보시면 H2 Database Engine이 실행된 것도 확인할 수 있습니다. 이제 브라우저의 H2 콘솔에서 Generic H2 (Embedded) 를 선택하시고 강의 내용대로 아래 이미지처럼 작성해주세요. 연결 시험(Test Connection)을 눌러보면 아래 이미지처럼 db가 없다고 나올 것입니다. 그렇지만 걱정 마시고 이 상태에서 연결을 눌러보세요. db가 생성된 화면을 만날 수 있습니다. 이제 db가 생성이 된 것입니다. 그렇기 때문에 뒤로 가기를 눌러 다시 로그인 화면이 뜬 후에 연결 시험(Test Connection)을 눌러보면 아까와는 다르게 Test Successful이라는 성공 메세지를 만날 수 있습니다. (그러나 이것은 브라우저의 H2 콘솔 URL의 포트를 보시면 아시겠지만, 저희 프로젝트에서 db가 만들어진 것이 아닙니다. 이에 대해서는 아래를 읽어주세요) 제가 H2 경험이 별로 없어서 해당 방식이 Embedded, In memory, Server 모드 3가지 중 어떤 방식인지 잘 모르지만 서버 방식으로 추측됩니다. 서버 방식은 H2를 따로 외부에서 띄워 놓고 접근해서 사용하는 것을 말하는 것 같은데요. 그렇기 때문에 저희가 만들어 놓은 프로젝트 URL인 localhost :{랜덤포트}/h2-console 에서 H2 사용 시 Embedded로 선택하여 Embedded 모드로 실행하면 연결 오류가 그대로 발생합니다. 그래서 강의와는 다르게 아래 이미지처럼 Server를 선택하여 외부(여기서는 프로젝트 외부에서 H2를 따로 동작시켜 db를 만들어준 것을 말함)의 H2에 접근하도록 연결해야 합니다. 연결 방법은 아래와 같이 URL을 적어주면 됩니다. Saved Settings와 JDBC URL 입력 항목을 유의해주세요. 이렇게 설정해준 후, Test Connection 버튼을 눌러보면 연결 테스트가 성공한 것을 확인할 수 있습니다. 마찬가지로 연결 버튼을 클릭해보면 연결도 잘 됩니다. 이제 이 상태에서 강의를 이어서 진행하면 문제 없을 것입니다. ※ 추가적으로, 외부에서 서버를 켜놓고 접속하는 것이기 때문에 오른쪽 트레이의 H2 Database Engine을 우클릭하여 종료하면 프로젝트의 H2 콘솔에서 연결이 불가합니다. 그러니 프로젝트 작업 시에는 트레이를 종료하지 않도록 유의해주세요. ※ 그리고, H2 Engine을 따로 받아서 서버 모드로 사용하면 DB 상태가 유지되지만, 이 방법은 프로젝트의 h2 jar 파일을 통해 진행하다보니 DB 상태가 유지되는지 알 수 없습니다. 오른쪽 트레이에서 H2를 재실행시키면 다시 DB를 만들어야 하는 것 같더라고요. 참고 부탁드려요~ [추가] Users Microservice - JPA①, ② 강의에서 H2 DB에 연결해 DB를 연결해주는데요. 위의 과정은 Embedded가 아닌 Server 로 처리하기 때문에 설정이 다릅니다. application.yml 파일에서 아래와 같이 설정해주세요. 유의하실 부분은 spring.datasource.url 부분과 spring.jpa.generate-ddl 부분입니다. url 만으로는 처리가 안되길래 jpa에서 db 생성하도록 generate-ddl을 true로 설정하였습니다. spring: application: name: user-service h2: console: enabled: true settings: web-allow-others: true path: /h2-console datasource: driver-class-name: org.h2.Driver url: jdbc:h2:tcp://localhost/mem:testdb username: sa jpa: generate-ddl: true
선생님 안녕하세요. 강의 듣고있는 수강생 입니다. 다름이 아니라 파이썬 프로젝트하면 포트폴리오로 활용하기에도 실용적으로 쓰기에도 불필요한 너무 작은 단위의 게임, 메모앱을 만든다든지 기껏해야 블로그만들기만 잔뜩 있는것 같습니다. 어쩌다가 인스타그램 만들기가 있구요. 혹시 파이썬 장고를 활용한 쇼핑몰 만들기 강의 개설에 대해서 계획이 있으신가요?