안녕하세요, 현재 강의를 수강하고 있습니다. 섹션4의 Github action부분을 듣고 있는데, 코드를 따라하는 중에 오류가 발생했는데, 어떤게 잘못되었는지 잘모르겠어서 질문 올립니다. 일부는 정상 실행된거 같아서, 서버가 작동하지 않거나 그룹이 잘못설정되지는 않은거 같은데, ChatGPT로 물어보니 Ubuntu가 맞지 않다고 얘기하고 있어서, 정확하게 어떻게 해야 할지 모르겠어서, 질문 올립니다. Ubuntu를 변경해야 한다면 처음부터 다시 셋업을 진행해야 할까요?
kafka confluent를 내부망에서 설치하여 사용중입니다. 잘 돌아가다가 라이선스 오류가 발생합니다. oracle-source.json파일을 수정 후 카프카에 적용해서 curl -s http://localhost:포트번호/connectors/oracle-source-connector/status 를 쳤는데 라이선스 오류 메시지가 나옵니다. 어떻게 해결해야 할까요? ...."trace":"org.apache.kafka.connect.errorsConnectException: Error validating license\n\tat org.apache.kafka.connect.runtime.licensing.ConnectWorkerLicenseManager.registerOrValidateWorkerLicense....
안녕하세요! 강의 너무 잘듣고 있습니다. 강의 실습 중 Spark UI에서 repartition(6) 전후로 persist 용량이 다르게 보여서 질문드립니다. 13:10 쯤 repartition 이전에는 디스크 사용량이 약 247.5 MiB 로 보였는데, 14:47 쯤 repartition(6) 이후에는 Memory 401.5 MiB / Disk 43.1 MiB 로 표시되었습니다. 같은 dataframe에 대한 persist를 수행했는데 repartition 전후로 용량 차이가 나는 이유가 궁금합니다.
안녕하세요 강사님. 강의 잘 듣고 있습니다. confluent kafka설치과정에서 setting_python_env.yml을 수행시키면 아래와 같은 오류가 계속 발생합니다. Add repo단계와 python 설치 단계에서 아래와 같은 오류가 발생합니다. 이유가 무엇일까요?
windows 환경 사용중인 교육생입니다. cmd에서 ssh -i public-nat-key.pem ec2-user@(public IPv4 address)명령어로 AWS NAT 인스턴스에 접속하려 하는데, ssh: connect to host (public IPv4 address) port 22: Connection timed out 이라는 문구가 뜨면서 접속이 되지 않습니다. 혹시 무슨 오류이고 어떻게 해결해야 할지 궁금합니다!
39강 consumer 배포환경 구축 강의에서 파이참 25.3.4 버전에서 프로젝트 생성시 name 항목이 없습니다. ai 에 물어보니 폴더명이 프로젝트 명이라고 나옵니다. producer 와 consumer 프로젝트가 공유되는 부분이 있어 한 폴더에 만들라고 했을텐데 어떻게 회피하면 될까요?? 더 낮은 버전으로 내려야 하나요??
안녕하세요! 강의 들으면서 poll_consumer를 1개 > 2개로 늘려보았습니다 실습을 해보니 강의 화면에서 보여지는 것 처럼 consumer가 모든 파티션을 읽지않더라구요 (consumer 개수를 1 ~ 3개까지 변경해보아도 모든 파티션을 읽지 않습니다) 컨슈머가 모든 파티션을 읽지 않는 이유가 있을까요?
안녕하세요~ 람다 아키텍처에서 speed layer 부분에 궁금한 점이 생겨 질문드립니다! Q1. speed layer는 어딘가에 저장이 된 후에 serving layer에서 보여지는건지 궁금합니다 저장이 된 결과가 보여지는 거라면 serving layer에서 전 날의 결과도 같이 보여지게 되는걸까요? 아니면 별도의 설정 같은 걸로 전 날 데이터는 삭제가 되는걸까요? Q2. speed layer에서 보여진 데이터가 다음 날에는 batch layer에 들어갈텐데 데이터 중복은 어떻게 처리할 수 있나요? 감사합니다!
아키텍처 설계 부분에서 궁금한 점이 있어 질문드립니다. 일반적으로 원천 → 수집 → 저장 → 처리 → 제공 → 활용 의 흐름으로 데이터 아키텍처를 설명해주셨는데, 이 중 원천 에 해당하는 부분에서 조금 헷갈리는 지점이 있습니다. 이전 강의에서 DW, DL, Lakehouse를 구축할 때 원천 데이터를 가져와 별도의 저장소에 다시 저장하며, 이 과정에서 데이터가 중복될 수 있고 그 중복이 필요한 이유에 대해서도 설명해주셨던 것으로 이해했습니다. 그래서 제가 이해한 내용을 예시로 확인하고 싶습니다. 예를 들어, 사내에 어떤 제품이 있고 해당 제품의 백엔드 서버가 RDB를 사용하며 서비스 데이터가 그 RDB에 저장되고 있다고 가정했을 때, DW, DL, Lakehouse를 구축하는 관점에서는 이 서비스용 RDB 자체가 raw data source(원천 데이터) 가 되고, 이 RDB로부터 데이터를 수집하여 DW, DL, Lakehouse 등에 다시 적재하는 구조로 이해했는데 이렇게 이해하는 것이 맞을지 궁금합니다.
안녕하세요 code deploy 배포에서 에러가 발생하여 문의 올리게 되엇습니다. s3 bucket 까지 tar.gz 파일 잘 업로드 되었습니다만 code deploy에서 아래 before install 에서 에러가 계속해서 발생하고 있는 상황입니다. 이전에 에러나신분 글읽어보니 ec2 인스턴스에서 logs파일을 보라고 하셨는데 저의 경우에는 로그파일이 생성이 되지 않는것 같습니다.
안녕하세요. 과제 도중 질문이 있어 질문 남깁니다. 우선 아래에 제가 작성한 코드 남기겠습니다! from pyspark.sql import SparkSession from pyspark.sql.functions import col import time spark = SparkSession.builder.appName("dataframe_cache").getOrCreate() # 회사별 산업도메인 CSV READ com_ind_path = 'hdfs://home/spark/sample/linkedin_jobs/company_industries.csv' com_ind_schema= 'company_id STRING, industry STRING' ind_df = spark.read.option("header", "true").option("multiline", "true").schema(com_ind_schema).csv(com_ind_path) # 회사별 종업원 수 CSV READ com_count_path = 'hdfs://home/spark/sample/linkedin_jobs/employee_counts.csv' com_count_schema = 'company_id STRING, employee_count INT, follower_count INT, time_recorded INT' count_df = spark.read.option("header", "true").option("multiline", "true").schema(com_count_schema).csv(com_count_path) # company_id 컬럼으로 중복 제거 후 진행 # drop_duplicate : transform 함수 company_count_df = count_df.dropDuplicates(['company_id']) # 캐시 저장 ind_df.persist() company_count_df.persist() # count : action 함수 print(ind_df.count()) print(company_count_df.count()) # filter : transform 함수 # it_df : 산업도메인이 IT Service and IT Consulting인 회사 # big_df : 직원 수가 1000명 이상인 회사 it_df = ind_df.filter(col('industry') == 'IT Services and IT Consulting') big_df = company_count_df.filter(col('employee_count') >= 1000) # join : transform 함수 it_big_df = it_df.join(big_df,'company_id','inner') # 결과 출력 it_big_df.select(['company_id','employee_count']).sort('employee_count',ascending=False).show() # 5분 대기 time.sleep(300) 저는 join 작업시 중복을 제거한 직원수 dataframe이 사용되기 때문에 dropDuplicates() 메서드를 적용한 뒤 persist()를 하여 캐시에 저장하였습니다. 그런데 강사님의 깃허브 코드를 확인하니, 중복을 제거한 dataframe에 persist()를 적용하지 않아서 제가 잘못 생각하고 있는 부분이 있는지 궁금합니다.
ec2-user$ curl -O https://dlcdn.apache.org/zookeeper/zookeeper-3.8.4/apache-zookeeper-3.8.4-bin.tar.gz 복사 붙여넣기 해도 오류가 나고 QnA에 뭐 복붙을 하면 오류가 발생할 수 있다하여 직접 타이핑을 해도 오류가 납니다.. 대체 왜이런건가요 ... 저기 링크로 직접 들어가봐도 아무것도 안떠요
수업 잘 따라가고있습니다 다름이 아니라 선생님과달리 저는 스파크 서브밋을 하면 선생님처럼SLf4J가 아니라 다른 로그가 나옵니다 그리고 선생님처럼 바로 실행되는게 아니라 약 40초에서 1분30초정도 걸려서 실행되는데 혹시 제가 빠뜨렸을법한 설정이 있을까요? 우선 실행만 되면 실습을 따라가는데 큰 문제는 없습니다.
안녕하세요 강사님! Airflow 강의에 이어 Kafka & Spark 강의도 열심히 듣고 있는 수강생입니다. 지난 Airflow 강의에서는 VSCode를 기반으로 실습을 진행했었는데, 이번 강의는 Pycharm으로 진행하시더라구요. 혹시 Pycharm 대신 VSCode를 사용하면 실습을 따라가는 데 있어서 신경써줘야 할 부분들이 좀 많을까요? 그게 아니라면 기존에 쓰던 VSCode를 기반으로 실습을 따라가고 싶어서요! 항상 좋은 강의, 그리고 친절한 답변 감사드립니다 :)