inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

173만명의 커뮤니티!! 함께 토론해봐요.

듣고있는 와중에 질문있습니다.

미해결

15일간의 빅데이터 파일럿 프로젝트

이 과정은 가이드 주시는데로 모든 프로그램을 다운받고 같이 따라해야 이수되는 교육인가요? 자바 다운로드에 들어가도 알려주신 버젼 대비 훨씬 더 업데이트 된 버전만 가능한 것 같네요. 꼭 정확하게 일치된 버젼을 설치해야 하는지요?

  • 빅데이터
  • hadoop
  • kafka
  • zookeeper
  • redis
  • flume
  • impala
  • 데이터-엔지니어링
김남수 댓글 1 좋아요 0 조회수 208

백업파일 테이블 생성 오류

미해결

다양한 사례로 익히는 SQL 데이터 분석

- 학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! - 먼저 유사한 질문이 있었는지 검색해보세요. - 서로 예의를 지키며 존중하는 문화를 만들어가요. - 잠깐! 인프런 서비스 운영 관련 문의는 1:1 문의하기를 이용해주세요. 주신 백업 파일로 같은 버전으로 받아서 데이터베이스에 업로드 했는데 테이블이 생성되지 않습니다. 스키마도요. 아무리 이리저리 해봐도 바뀌지 않아서 방법을 여쭤봅니다

  • sql
  • postgresql
  • dbms/rdbms
  • 퍼포먼스-마케팅
  • 데이터-엔지니어링
ajh7457 댓글 1 좋아요 0 조회수 266

min.insync.replicas 설정에 따른 Producer 전송 이해 관한 질문입니다.

미해결

카프카 완벽 가이드 - 코어편

안녕하세요 선생님 질문이 있습니다. 해당 강의자료에서는 producer가 leader partition에게 보낸 메시지를 leader가 follower에게 복제하는 그림(화살표)이던데 이 과정은 전강의( ISR(In-Sync_Replicas)의 이해 )에서 follower들이 fetch해서 가져가는 것과는 별개인것인가요? 화살표(data전송방향)가 달라서 질문드립니다.

  • kafka
  • 데이터-엔지니어링
dohyun_lim 댓글 1 좋아요 0 조회수 176

consumer 재배포시 리밸런싱 이슈

미해결

[아파치 카프카 애플리케이션 프로그래밍] 개념부터 컨슈머, 프로듀서, 커넥트, 스트림즈까지!

안녕하세요 consumer 로직이 변경 시 consumer를 재배포할 경우 리밸런싱이 발생하는 이슈가 존재합니다. 실제 운영에서는 로직을 별도로 분리해서 로직만 재배포한다는 것을 세미나에서 듣게 되었는데 Dev원영님도 이렇게 운영하고 계신가요? 또한 이때 로직을 분리한 서버를 rest-api vs gRPC 어느 것으로 실제 운영하고 계신지 궁금합니다.

  • kafka
  • 데이터-엔지니어링
  • consumer
박준형 댓글 2 좋아요 0 조회수 304

.env 파일 변수를 PythonOperator에 적용할 경우 질문드립니다!

미해결

Airflow 마스터 클래스

안녕하세요! 강사님 서울시 공공데이터 API를 이용해 데이터를 추출하는 것을 보고 저도 넥슨 오픈 API를 가지고 데이터를 출력해보려고 DAG과 PythonOperator를 만들어봤는데요, 보통 민감정보는 .env파일에다 적어놓고 가져와서 사용하기에 이렇게 짰는데, .env파일은 gitignore에 들어가니 dag실행시 읽어올 수가 없는데 이런 경우는 어떻게 할까요...? 강의에서 보여주신 것처럼 서울시 공공 api에서 simplehttpoperator를 사용하고, airflow웹에서 variable 변수를 사용했듯이 이것도 이렇게 해야할까요..?!

  • python
  • 데이터-엔지니어링
  • airflow
rosy 댓글 1 좋아요 0 조회수 197

permission denied 오류 관련 문의드립니다!

해결됨

Airflow 마스터 클래스

안녕하세요! 강사님 질문이 하나 있는데요, 제가 중간에 docker를 삭제했다가 다시 설치해서 하고 있는데 다른 것들은 잘 되는데, 서울시 공공 데이터 API를 가지고 Custome Operator를 하는 과정에서 dags_seoul_api_ corona.py 이 실행이 안되어서 문의드려요! 처음에 directory가 없다는 오류가 떠서 생성하는 코드를 추가해봤는데, 추가한 이후에 dag 실행해도 실패해서 로그를 확인해보니 permission 거부 문제로 오류가 발생한 것을 확인하였습니다. docker-compose.yaml에서 volumes는 잘 설정되었는데, 혹시 제가 AIRFLOW_CORE_EXECUTOR를 LocalExecutor로 바꾼 게 문제가 되었을까요? databricks와 airflow를 연동하면서 dns를 설정하고, command를 좀 수정하였는데 이 부분이 문제였을까요...? ChatGPT에 물어보니 Webserver로 들어가서 Docker 컨테이너 내에서 이 디렉토리의 소유자를 airflow 사용자로 변경하면 된다고 하는데, [sudo] password for default: 부분에서 비밀번호 에러가 나네요...! 저는 따로 default에 대한 비밀번호를 설정하지 않아서 해당 비밀번호를 잘 모르는 상태입니다..! docker를 재설치해야할 것 같은데... 하기 전에 강사님께 문의 드립니다! 편하게 답변 주시면 감사하겠습니다!!

  • python
  • 데이터-엔지니어링
  • airflow
rosy 댓글 2 좋아요 0 조회수 566

카프카 스트림즈 애플리케이션이 죽는 경우가 발생하는지

미해결

[아파치 카프카 애플리케이션 프로그래밍] 개념부터 컨슈머, 프로듀서, 커넥트, 스트림즈까지!

안녕하세요 데브원영님! 현재 카프카를 적용한 프로젝트 개발 중에 있습니다. 카프카 스트림즈(DSL)를 자바 애플리케이션안에 자바 모듈로 구현을 한 상태입니다. 현재 카프카 브로커로 들어오는 데이터는 초당 50건~200건 가량이며 한 건 당 2000byte 정도 데이터를 받고 있습니다. 현재는 모든 데이터를 한 토픽에서 받고, 그 모든 데이터가 담긴 토픽을 목적별로(차, 청소 등..) 만든 토픽에 필터링 하고 있습니다. 필터링하는 로직이 복잡하지는 않습니다. (코드상 10줄 미만) 그런데 이런 상황에서 운영 중에 만약에 , 카프카 스트림즈가 부하가 많아질 경우나 네트워크 등 다른 이슈로 스트림즈 애플리케이션이 죽지는 않을까 하는 걱정이 있습니다. 질문입니다. 혹시 이렇게 자바 코드로 작성한 스트림즈 애플리케이션이 죽는 상황이 있나요? (부하 또는 기타 문제로...) 있을 경우 대비를 한다면 스트림즈 애플리케이션을 자바 코드가 아닌 따로 프로젝트를 만들어(WAS를 따로 생성) 운영을 해야할까요? 스트림즈 애플리케이션이 죽는 경우는 어느정도의 부하(초당 몇 바이트정도인지.. 보통..)가 있어야 죽는 경우가 발생하나요? (CPU성능, 메모리 등 PC스펙이 충분하다고 할 경우에요..) 만약 WAS를 따로 만들어서 운영해야 한다면, WAS를 보통 여러 개 정도 두나요? 아니면 WAS를 1개만 만들고 WAS 내 스트림즈 스레드를 여러 개로 만들어서 운영하나요? 아니면 여러개 WAS에 여러개 스레드를 띄우나요? WAS를 여러개 두는 경우, 1개 WAS가 죽으면 자동으로 fail over 가 되나요? 안된다면 어떻게 fail over가 되도록 구현해야 하나요? 미리 감사합니다.

  • kafka
  • 데이터-엔지니어링
Hyun Yoo 댓글 2 좋아요 0 조회수 300

MySQL에서는 숫자 타입 컬럼에서 '', ""를 함께 사용해도 되나요?

해결됨

[리뉴얼] 처음하는 SQL과 데이터베이스(MySQL) 부트캠프 [입문부터 활용까지]

안녕하세요, 실전 SQL 데이터분석 연습: 집계 함수 익히고 실제 DB로 연습하기 (업데이트) 13:00~ 부분의 연습문제8 관련하여 궁금한 사항이 있어서 문의 드립니다. 문제는 영화 렌탈 테이블(rental)에서 inventory_id가 367이고, staff_id가 1인 로우(Row) 전체 출력하기 입니다. Rental 테이블의 inventory_id 컬럼은 타입이 mediumint, staff_id는 tinyint 인 것 같습니다. 그런데 정수 타입의 컬럼인데 Where 조건 절에서 ''를 써도 동일하게 결과값이 조회가 되는 것 같더라구요. 제가 잘못 알고 있을 수도 있지만 정수와 같은 숫자 타입의 경우 값을 '' 혹은 "" 없이 입력하고, Str 같은 문자의 경우 '', "" 를 값에 함께 입력해야 문자타입으로 인식하는 것 같은데 혹시 MySQL에서는 컬럼타입에 있어서 이러한 구분 없이 사용이 되는 것일까요? 따옴표 ('') 없이 조건 값을 입력해서 조회했을 경우 따옴표를 함께 조건에 입력해서 조회했을 경우 감사합니다.

  • python
  • sql
  • mysql
  • dbms/rdbms
  • 데이터-엔지니어링
Blossom0518 댓글 1 좋아요 0 조회수 196

안녕하세요

미해결

카프카 완벽 가이드 - 코어편

안녕하세요 맥북 m2 사용자라 utm에서 ubuntu 설치하고 진행하는데 주소, 네트워크 주소, 게이트웨이(찾아보니 yaml 하라고 해서 )부터 너무 막히는데 하나씩 utm 방법으로 찾아서 진행해야하는 건지 아니면 다른 방법이 있는지 궁금합니다

  • kafka
  • 데이터-엔지니어링
조소영 댓글 1 좋아요 0 조회수 330

DCL 강의 파트 CLI 입력 창에서 잘못 입력 시 취소하는 방법

미해결

[리뉴얼] 처음하는 SQL과 데이터베이스(MySQL) 부트캠프 [입문부터 활용까지]

안녕하세요, 수업을 들으면서 간혹 타자를 잘못 치게 되는 경우가 있는데 이럴때 입력 창에서 어떻게 뒤로 가기를 하거나 빠져나갈 수 있는 방법이 있을까요? 예를들어 제가 exit을 입력해야 하는데 잘못하여 'by'로 잘못 입력 후 엔터를 치니 화살표가 뜨면서 계속 해당 칸에서만 입력이 가능합니다. 이런 경우 어떻게 원래 입력위치로 돌아가서 'exit'으로 입력을 할 수 있을까요? 현재로서는 방법을 알지 못하여 창을 아예 껐다가 모든 명령어를 다시 입력 후 재진행하고 있으나 혹시 이와 같은 상황에서 명령어로 수정이 가능할 지 궁금하여 문의드립니다. 감사합니다.

  • python
  • sql
  • mysql
  • dbms/rdbms
  • 데이터-엔지니어링
댓글 1 좋아요 0 조회수 304

회귀분석 관련 질문 드립니다.

미해결

15일간의 빅데이터 파일럿 프로젝트

R을 이용한 회귀분석 강의에서 smartcarMaster2Income에 있는 capacity를 feature로 income이라는 lable을 예측하는 것으로 이해했는데 분석에 사용된 데이터를 통해 얻은 모델을 검증하는 과정에서 Test파일을 가지고 predict를 하고나서 동일한 파일과 비교를 하는게 잘 이해가 되지 않아서 질문 드립니다. 모델을 검증?추론?할때는 lable값이 없는 데이터를 넣고 그 결과가 실제데이터(test파일)과 얼마나 가까운지를 확인하는 것이 아닌가요?

  • 빅데이터
  • hadoop
  • kafka
  • zookeeper
  • redis
  • flume
  • impala
  • 데이터-엔지니어링
dominicus 댓글 1 좋아요 0 조회수 186

"사용자별 특정 상품 주문시 함께 가장 많이 주문된 다른 상품 추출하기"에서 조건관련..

미해결

다양한 사례로 익히는 SQL 데이터 분석

주문별 고객별 연관 상품 추출 SQL로 구하기 -02 강의를 듣던중 궁금한점이 있어 글을 남기게 되었습니다. 임시테이블 temp_01 에서 인데요.. 고객별 주문별 연관상품 추출하려면 user_id도 같아야하겠지만, order_id(주문번호)도 같다는 조건 하에 self join해야하지 않을까 싶어서요. select a . user_id , a . product_id as prod_01 , b . product_id as prod_02 from temp_00 a join temp_00 b on a . user_id = b . user_id and a . order_id = b . order_id -- 이 부분 추가되어야하지 않을지 궁금합니다. where a . product_id != b . product_id 감사합니다.

  • sql
  • postgresql
  • dbms/rdbms
  • 퍼포먼스-마케팅
  • 데이터-엔지니어링
Youngkuk Sohn 댓글 1 좋아요 0 조회수 188

연결 브로커 지정

미해결

[아파치 카프카 애플리케이션 프로그래밍] 개념부터 컨슈머, 프로듀서, 커넥트, 스트림즈까지!

안녕하세요 클러스터에 브로커가 100개, 토픽 A에 파티션 5개, 복제 3개 인 상황 이라고 가정하겠습니다. 프로듀서는 리더 파티션이 존재하는 브로커와 통신을 해야하는데 브로커 100개 중 리더 파티션 5개가 분배될 것인데 클라이언트 입장에서는 리더 파티션이 있는 브로커를 모릅니다. 이 때 bootstrap.servers에 100개 중 아무 브로커 2개만 적어 주면 알아서 리더 파티션이 있는 브로커를 알려주나요? bootstrap.servers에 몇 개의 브로커를 적는게 올바른가요?

  • kafka
  • 데이터-엔지니어링
박준형 댓글 2 좋아요 0 조회수 211

동영상 재생이 안됩니다.

미해결

Data Engineering Course (1) : 빅데이터 하둡 직접 설치하기

- 학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! - 먼저 유사한 질문이 있었는지 검색해보세요. - 서로 예의를 지키며 존중하는 문화를 만들어가요. - 잠깐! 인프런 서비스 운영 관련 문의는 1:1 문의하기를 이용해주세요. 동영상 재생이 너무 느립니다. 그나마 엣지에서는 버벅 거리면서 돌아가긴 했는데, 크롬에 최적화 되어 있다고 해서 크롬으로 해보니 동영상 재생 자체가 안되네요. 계속 로딩만 하고.. 해결 방법이 없을까요?

  • 빅데이터
  • hadoop
  • 데이터-엔지니어링
윤면용 댓글 2 좋아요 0 조회수 322

localhost:8080 에서 로그인이 안됩니다.

미해결

Airflow 마스터 클래스

위 상황에서 인터넷창에 localhost:8080 후 진입하면 우선 선생님과 같은 로그인 화면이 아닌 다른 UI가 나옵니다. 그리고 초기 아이디/비번으로 설정된 airflow/airflow 로 시도해도 로그인이 안되고 있어서 해결방법을 알수있을까요?

  • python
  • 데이터-엔지니어링
  • airflow
이정민 댓글 2 좋아요 0 조회수 392

task 동시성 제한 및 중복 호출 방지

해결됨

Airflow 마스터 클래스

안녕하세요, 수업을 대부분 수강하고 실제 현업에서 사용중에 있는데 문의사항이 있어서 질문 드립니다. 현재 상황은 이렇습니다. DAG 구성 - 5분단위 스케줄링 -4개의 task - task1 >> task2 >> task3 >> task4 - 각 task 별 timeout =5분 문제 상황은 task 2번이 한달에 한번씩 data 가 많아지면 5분까지 타임아웃이 걸릴때가 있는 것인데요, 이때 그다음 Dag run 이 수행되면서 task 2 번이 동시에 수행 되는 시간이 조금 있는데 그때 데이터 처리가 중복으로 처리되는 현상이 발생하게 됩니다. 그래서 가능하면 task2 을 동시에 돌리는걸 막고 싶었는데요, 처음 생각해낸 방법은 task_concurrency 옵션을 task 에 주어서 1개만 돌수 있게 바꾸고 timeout 을 조금더 넉넉하게 주려고 했으나, 만에하나 해당 task 가 10분이상 걸린다면 dag run 이 수행되고있는것 제외 2개가 더 웨이팅을 하는것이 되고, 이게 누적이 될수도 있을것으로 보여서 문제로 인지 했습니다. 서비스 적으로 5분내에 돌수 있게 하거나, 아니면 5분 스케줄링을 변경하는 방법을 고려해야 하지만 해당 고려 없이 혹시 airflow 단에서 할수 있는 작업이 있을까요? ex . runninng 중인 task 와 대기중인 task 가 하나정도 있다면 해당 task 는 스킵하는 옵션 등입니다..

  • python
  • 데이터-엔지니어링
  • airflow
qkswl6253 댓글 1 좋아요 0 조회수 238

airflow와 postgres간의 connection 오류

미해결

실리콘밸리 엔지니어와 함께하는 Apache Airflow

airflow와 postgres 간의 connection 오류 문제입니다. airflow UI -> admin-> connections에서 postgres 연결설정 docker-compose.yaml 설정 dag 코드 입력 airflow tasks test postgres_loader execute_sql_query 2023-01-01 시에 오류가 뜹니다ㅠ [2024-06-21T15:40:45.514+0900] { dagbag.py:545 } INFO - Filling up the DagBag from /home/kim/airflow/dags [2024-06-21T15:40:45.805+0900] { taskinstance.py:2076 } INFO - Dependencies all met for dep_context=non-requeueable deps ti=<TaskInstance: postgres_loader.execute_sql_query __airflow_temporary_run_2024-06-21T06:40:45.755970+00:00__ [None]> [2024-06-21T15:40:45.811+0900] { taskinstance.py:2076 } INFO - Dependencies all met for dep_context=requeueable deps ti=<TaskInstance: postgres_loader.execute_sql_query __airflow_temporary_run_2024-06-21T06:40:45.755970+00:00__ [None]> [2024-06-21T15:40:45.812+0900] { taskinstance.py:2306 } INFO - Starting attempt 1 of 1 [2024-06-21T15:40:45.812+0900] { taskinstance.py:2388 } WARNING - cannot record queued_duration for task execute_sql_query because previous state change time has not been saved [2024-06-21T15:40:45.813+0900] { taskinstance.py:2330 } INFO - Executing <Task(PostgresOperator): execute_sql_query> on 2023-01-01 00:00:00+00:00 [2024-06-21T15:40:45.855+0900] { taskinstance.py:2648 } INFO - Exporting env vars: AIRFLOW_CTX_DAG_OWNER='airflow' AIRFLOW_CTX_DAG_ID='postgres_loader' AIRFLOW_CTX_TASK_ID='execute_sql_query' AIRFLOW_CTX_EXECUTION_DATE='2023-01-01T00:00:00+00:00' AIRFLOW_CTX_TRY_NUMBER='1' AIRFLOW_CTX_DAG_RUN_ID='__airflow_temporary_run_2024-06-21T06:40:45.755970+00:00__' [2024-06-21T15:40:45.858+0900] { taskinstance.py:430 } INFO - ::endgroup:: [2024-06-21T15:40:45.870+0900] { sql.py:276 } INFO - Executing: INSERT INTO sample_table (key, value) VALUES ('hello', 'world') [2024-06-21T15:40:45.875+0900] { taskinstance.py:441 } INFO - ::group::Post task execution logs [2024-06-21T15:40:45.875+0900] { taskinstance.py:2905 } ERROR - Task failed with exception Traceback (most recent call last): File "/home/kim/.local/lib/python3.10/site-packages/airflow/models/ taskinstance.py ", line 465, in _execute_task result = _execute_callable(context=context, **execute_callable_kwargs) File "/home/kim/.local/lib/python3.10/site-packages/airflow/models/ taskinstance.py ", line 432, in _execute_callable return execute_callable(context=context, **execute_callable_kwargs) File "/home/kim/.local/lib/python3.10/site-packages/airflow/models/ baseoperator.py ", line 401, in wrapper return func(self, *args, **kwargs) File "/home/kim/.local/lib/python3.10/site-packages/airflow/providers/common/sql/operators/ sql.py ", line 277, in execute hook = self.get_db_hook() File "/home/kim/.local/lib/python3.10/site-packages/airflow/providers/common/sql/operators/ sql.py ", line 188, in get_db_hook return self._hook File "/usr/lib/python3.10/ functools.py ", line 981, in __get__ val = self.func(instance) File "/home/kim/.local/lib/python3.10/site-packages/airflow/providers/common/sql/operators/ sql.py ", line 150, in _hook conn = BaseHook.get_connection(conn_id) File "/home/kim/.local/lib/python3.10/site-packages/airflow/hooks/ base.py ", line 83, in get_connection conn = Connection.get_connection_from_secrets(conn_id) File "/home/kim/.local/lib/python3.10/site-packages/airflow/models/ connection.py ", line 519, in get_connection_from_secrets raise AirflowNotFoundException(f"The conn_id `{conn_id}` isn't defined") airflow.exceptions.AirflowNotFoundException: The conn_id `my_postgres_connection` isn't defined

  • python
  • 빅데이터
  • 데이터-엔지니어링
  • airflow
style12385 댓글 4 좋아요 1 조회수 1213

안녕하세요 질문이 있어 문의드립니다.

미해결

카프카 완벽 가이드 - 커넥트(Connect) 편

이미 Kafka Core편은 들었고 현재 Kafka Connect부분중 Sink Connector듣기 전입니다. 이 강의를 듣게된 동기이기도 한데요.. DBToDB방식으로 해결하지 않고 Source Connector가 없이 Topic를 만들고 Topic에 Produce하는 방법이 가능한지요? Topic에 생성된 메시지는 Sink Connector 로 DB에 적재되는 구조입니다. Topic의 메시지 구조는 Source Connector에서 생성된 Message 체계로 Topic에 메시지를 적재하는 식으로 처리할려고 합니다. Kafka core에서 배웠던 Produce하는 방법을 이용하는경우입니다. 정리) Source Connector없이 Topic에 메시지를 보내고 이를 SinkConnect로 DB에 적재하는게 가능한지요? 감사합니다.

  • kafka
  • 데이터-엔지니어링
myksh7 댓글 1 좋아요 0 조회수 216

인기 태그

인프런 TOP Writers

주간 인기글