빅데이터/텍스트마이닝 분석법 (LDA,BERTtopic,감성분석,CONCOR with ChatGPT)
안녕하세요 선생님 제가 LDA분석방법으로 연구를 진행중인데 이 LDA분석 방법의 단점을 개선한 방법으로 딥러닝 방식인 BERTopic 분석 방법이 최근 등장해서 연구논문에 조금씩 등장하는걸 확인했습니다. 그래서 이 분석 방법에 흥미가 생겨 어떻게 할 수 있는지 인터넷, 책 등을 아무리 찾아봐도 직접적으로 연구에 어떻게 적용해서 하는 건지, 딥러닝 방식이라 학습시키는 데이터(말뭉치)는 또 어떻게 준비하는 건지.. 도통 모르겠고 도움을 받을 수 있는 길이 없는거 같아서 답답한 마음에 한번 여쭤봅니다. 혹시 연구논문에 적용가능한 BERTopic 분석 방법에 대한 강의를 올려주실 계획은 없으실지 궁금합니다!
안녕하세요 비전공자 직장인입니다. 퇴근후 딴짓 님 강의를 열심히 듣고 있습니다. 현재 작업형2 모의문제 2를 혼자서 풀고 있는데, 단순한 결측치 찾고, 샘플 찾고, 그런 것들은 하겠는데 이거를 모델링 하는 거에서부터 사실 멘붕입니다. 작업형1 모의문제를 풀 때도 똑같이 강의를 듣던것보다 더 어려워서 멘붕이 왔었습니다. 일단은 모르겠는 부분은 인지한 상태로 다시 반복하겠다는 의지로 계속 강의를 듣는 게 맞겠죠? 반복이 답이겠죠??
선생님, 강의 열심히 보고 있는데 제가 5월 중순부터 시작하면서 조금 일찍 시작했는데도 불구하고 암기 할 게 너~~~~~~무 많아서 큰일입니다 ㅠㅠ 단권화 시키려고 실기용 교재를 샀는데 정말 정말 이것만큼은 꼭! 외우고 가야하는 코드나 문법같은거를 정리해주실 수 있나요? (강의나...파일로) 사실 고득점 합격은 바라지도 않고 60점 턱걸이로라도 너무 붙고싶습니다!
어느 강의영상에 질문을 남겨야할지 감이 안잡혀 여기에 질문 남깁니다…. 웹 개발을 할 때 DDL을 통해 생성되는 테이블들은 모두 서비스에서 사용되는 객체들을 보고 만드는것 같은데 (예를 들면 Member 클래스, Item클레스들을 생각했습니다) 만약 어떤 회원 A가 아이템A를 등록하였으면 데이터 베이스의 회원과 아이템 사이에는 등록이라는 관계가 생성이 되고 회원 1명은 아이템을 여러개 등록이 가능하다면 Member 테이블의 PK를 Item 테이블의 FK로 등록되며 Item 테이블의 속성들은 (id, item_name, price, quantity, member_id)로 설정이 될것 같은데 이런 경우 Item 클레스의 멤버변수로 Member member_id; 를 생성해주어야 할것 같은데 이런 외래키 값은 도메인을 설계할때 어떻게 처리해야 하나요? 그리고 api로 통신할 때 클라이언트 에게 데이터를 넘겨줄 때 스프링 입문 강의에서 hello 객체자체를 return 하면 스프링의 잭슨라이브러리가 json포멧으로 변환해서 넘겨준다고 해주셨는데 여러개의 테이블이 조인된 결과를 json으로 반환 해주려면 (예를 들어서 멤버 A가 등록한 아이템의 이름과 가격, 멤버의 이름을 요청한다면 반환되는 튜플이 item_name, price, member_name) 이것들은 하나의 객체가 아닌 Member클래스와 Item클래스의 일부 변수들을 사용한 새로운 값들인데 이럴때는 어떤 방법으로 return해주어야 하나요? 클라이언트측과 조율을 하여 검색되는 조건을 설정하여 조인검색의 제약을 설정하나요? 제약을 설정한다면 반환할 때 (item_name, price, member_name) 이 3개의 속성들을 멤버변수로 사용하는 새로운 클래스를 생성하여 반환해 주어야 하나요? 항상 질문글에 상세한 답글 남겨주셔서 열심히 공부할 수 있습니다. 감사합니다.
안녕하세요 선생님 빅데이터 분석에 관심이 있어 파이썬을 1도 모르는 상태에서 시작해 현재 선생님의 강의를 통해 많은 도움을 받고 있습니다. 현재 텍스트 마이닝 분석 방법으로 쓴 논문들을 보면 쇼핑몰 댓글 부터 해서 각종 SNS(페이스북, 인스타그램 등)의 댓글을 분석한 논문들을 많이 살펴볼 수 있는데 현재 파이썬 초보로서 데이터를 수집하는 과정(웹크롤링)이 제일 중요하고도 어려운 것 같습니다. 현재 텍스톰이나 빅카인즈 같은 웹사이트를 이용하는 것 말고 파이썬 으로 다양한 데이터를 직접 웹크롤링 해서 데이터를 수집하는 방법을 집중적으로 다룬 강의는 거의 찾아보기 어렵더라구요..ㅠㅠ 블로그 등에 검색해보면 코드가 공개된 것도 있지만 여기저기 코드 방식이 다 다양하고 막상 적용해서 실행해보면 또 에러 생기고 이유는 모르겠고 답답하더라구요. SNS 채널 및 쇼핑몰 댓글 등을 웹크롤링 하는 과정을 하나하나 다 보여주는 강의가 있으면 좋겠다고 생각하고 있는데 혹시 이렇게 여러 채널의 웹크롤링 과정만 다룬 강의를 올려주실 계획은 없으신지요?
안녕하세요. "실무로 배우는 빅데이터 기술" 교재와 15일간의 빅데이터 파일럿 프로젝트 강의에 열정을 쏟고 있는 학생입니다. 커뮤니티 게시판에 '고민있어요' 배너를 보고, 제 학습과 관련된 고민을 나누고자 글을 쓰게 되었습니다. 제 경험을 간단히 소개하자면, 약 2년간 직장에서 파이썬을 활용하여 크롤링, 분산 처리, API, DB 관리 등을 통해 데이터 수집 및 모델링 업무를 해왔습니다. 이후 데이터 엔지니어로 전환하면서, 본격적으로 이 분야를 공부하기 시작했습니다. Hadoop 생태계나 리눅스는 이전에는 이름만 들어본 적이 있었는데, 이번 강의를 통해 직접 프레임워크를 구축하고 설정하며, 데이터를 쌓아보는 경험은 정말 뜻깊습니다. 특히 Cloudera나 Git에서 'bigdata2nd-master' tar 파일을 받아 시스템을 구축하는 과정을 통해 전체적인 워크플로우와 업무에 대한 이해를 넓힐 수 있었던 점은 다른 어떤 강의보다 만족스러웠습니다. 처음 프레임워크를 하나하나 구축하고 설정하는 과정이 매우 어렵게 느껴졌는데, 이번 강의를 통해 크게 성장할 수 있었습니다. 강의 중 강사님께서는 프레임워크 자체에 집착하기보다는, 요구사항을 통해 세부적인 요구사항을 도출하고, 이를 해결하는 방법에 중점을 두라는 조언을 주셨습니다. 프레임워크가 어떻게 활용되는지를 이해하고, 실제 문제 해결에 적용하는 방향으로 학습하라는 조언은 매우 감사했습니다. 하지만, 저의 고민은 여기서 시작됩니다. 저만의 공부와 업무를 진행할 때, 대부분의 경우 도커 컨테이너 내에서 conf, yaml, Dockerfile 등을 직접 구성하거나 수정해야 할 것으로 압니다. Cloudera를 사용하지 않고 직접 프레임워크를 설계하며 공부를 해보고 싶은데, 이에 관련된 다른 강의나 학습 방향에 대한 조언을 구할 수 있을까요? 긴 글 읽어주셔서 감사합니다.
[실전]텍스톰 TEXTOM 실전 강의: 빅데이터 논문 작성을 위한 텍스트 분석/텍스트마이닝
N-gram 분석은 N개 단어의 연쇄를 확률적인 수치를 산출하고 시각화하는 방법으로 대용량의 문서에서 특정 단어 뒤에 위치하는 단어나 음절의 빈도를 정량적인 수치로 나타낼 수 있다(Kang & Lee, 20019). 단어 간 연결방향이 화살표를 통해 시각화되며 화살표의 굵기 크기를 통해 연결강도가 결정된다(Yoo et al., 2019). 또한 연관 단어 간 관계성을 분석하면 단어간 관계 파악에 용이다하다(Kim, 2020). 본 연구에서는 Textom에서 제공하는 N-gram 텍스트마이닝 기법 시 데이터의 흐름과 이해를 하기 위해 가장 먼저 기초 분석 자료로 활용되는 기법이기도 하다. 단어빈도에 기반한 분석은 전체 문서 내에서 특정 단어의 풀현 빈도를 나타낸다. 문서 내에 특정 단어가 등장하는 횟수를 나타내며 이수치값이 클수록 문서에서 자주 사용하는 단어임을 의미한다(Jang et al.,2018). 높은 출현 빈도를 나타내는 단어는 대체로 연구주제와 관련된 함축된 의미를 내재하고 핵심 단어로 작용 할 수도 있다(Lee,2022).
하나 여쭤보고 싶은게 있는데, 기존에 NestJS를 사용하다가 Spring으로 전향하게 되어, NestJS로 작성된 토이 프로젝트를 Spring으로 변환하면서 강의 내용을 체득해보려고 합니다! 토이 프로젝트의 규모도 꽤 크고, 기존에 GraphQL로 작성된 쿼리들을 REST API로 변경할 계획인지라 사실상 새로 제작한다에 가까울 것 같습니다. 이걸 어떤 강의까지 들은 뒤 작업할 지 고민이 되는데, 혹시 조언을 주실 수 있을까요? 1. DB 2편 2. 스프링 완전 정복 로드맵 3. DB 2편까지 듣고, JPA 실무 완전 정복 로드맵까지 4. 스프링 완전 정복 로드맵과 JPA 실무 완전 정복 로드맵까지 현재 DB 2편 듣고 있는 중이며, 이 강의를 듣기 전엔 Spring에 대한 기반 지식이 아예 없었던 상태입니다. 조언 감사합니다!
커뮤니티에서 Mybatis 관련 비슷한 오류가 많아 보이길레, 여러분들의 시간을 아껴드리고자 제가 해결한 방법을 공유해드립니다. Mapper bean not found 저의 경우 Spring Boot 버전과 MyBatis 버전 불일치 문제여서 Mapper 빈 생성이 정상 작동하지 않았었습니다. (Mapper Spring 연동 모듈이 정상 작동하지 않은 문제??) // build.gradle plugins { id 'org.springframework.boot' version '2.6.5' id 'io.spring.dependency-management' version '1.0.11.RELEASE' id 'java' } 스프링 부트 3.0 이상 버전만 썼기 때문에 습관상 당연히 3.0 버전과 호환이 되는 MyBatis 버전 3.0.1 을 설정했지만 위와 같이 영한님의 수업 자료로 진행하셨다면 스프링 2.6.5 로 설정되어 있기 때문에 // build.gradle dependencies { //MyBatis 추가 implementation 'org.mybatis.spring.boot:mybatis-spring-boot-starter:2.2.0' } 이렇게 바꾸시면 되실 겁니다! Invalid boud statement (not found) XML 파일에 오타가 있거나 XML 파일 경로 설정이 이상할 경우 발생하는 오류라 합니다 ItemMapper.xml 파일 경로를 잘 따라한 것 같엤는데 경로가 복잡하기도 했고 그래서 pdf 수업 자료 2번째 방법인 resources/mapper/ItemMapper.xml 로 xml 파일을 옮겼고 (기존 껀 부모 디렉토리까지 삭제) // application.properties #MyBatis mybatis.type-aliases-package=hello.itemservice.domain mybatis.configuration.map-underscore-to-camel-case=true logging.level.hello.itemservice.repository.mybatis=trace mybatis.mapper-locations=classpath:mapper/**/*.xml 설정 파일에 마지막 줄 (mapper 경로 설정) 을 추가해서 해결했습니다. 저와 동일한 문제가 아니신 분들도 계시겠지만 같은 수업 자료에서 출발했기 때문에 비슷하게 해결되지 않을까 싶어서 글 적었습니다! (질문글이 아니지만)