inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

173만명의 커뮤니티!! 함께 토론해봐요.

table의 데이터가 실시간으로 topic에 담기지 않습니다

미해결

카프카 완벽 가이드 - ksqlDB

mysql에 debezium source connector로 topic에 가져온 데이터를 받는 stream을 만들고 그 stream을 기반으로 하여 CREATE TABLE timeout WITH (KAFKA_TOPIC='timeout' , KEY_FORMAT='AVRO', VALUE_FORMAT='AVRO', PARTITIONS=1) AS > SELECT > order_id -> order_id AS order_id, > TIMESTAMPADD(MILLISECONDS, 9 * 3600 * 1000, PARSE_TIMESTAMP(LATEST_BY_OFFSET(order_datetime), 'yyyy-MM-dd''T''HH:mm:ssX')) AS last_log_time > FROM orders > GROUP BY order_id -> order_id > HAVING ((UNIX_TIMESTAMP(CONVERT_TZ(FROM_UNIXTIME(UNIX_TIMESTAMP()), 'UTC', 'Asia/Seoul')) - UNIX_TIMESTAMP(TIMESTAMPADD(MILLISECONDS, 9 * 3600 * 1000, PARSE_TIMESTAMP(LATEST_BY_OFFSET(order_datetime), 'yyyy-MM-dd''T''HH:mm:ssX')))) / 1000 > 600) > EMIT CHANGES; 이런식으로 id별로 마지막 로그 시간이 오고 10분 이상이 지나면 table에 담기도록 만들었습니다 처음에 이미 10분이 지난 데이터를 넣으면 table에도 들어가고 topic에도 잘 들어가는데 현재시간의 데이터를 넣고 10분이 지나면 table에는 들어가는데 topic에는 들어가지 않습니다 table에도 담기고 topic에도 담기려면 어떻게 해야하나요? 아니면 원래 불가능한건가요? 기반한 stream은 데이터를 넣으면 곧 바로 stream과 토픽에 잘 들어갑니다. |ORDER_ID |CALCULATED_TIME |LAST_LOG_TIME | +------------------------------------------+------------------------------------------+------------------------------------------+ |1 |78088 |2024-06-16T12:30:00.000 | |2 |69988 |2024-06-16T14:45:00.000 | |3 |72088 |2024-06-16T14:10:00.000 | |4 |32739088 |2023-06-04T12:00:00.000 | |5 |32637088 |2023-06-05T16:20:00.000 | |6 |32567788 |2023-06-06T11:35:00.000 | |7 |69058 |2024-06-16T15:00:30.000 | |8 |68698 |2024-06-16T15:06:30.000 | |9 |66958 |2024-06-16T15:35:30.000 | |10 |65698 |2024-06-16T15:56:30.000 | |11 |66298 |2024-06-16T15:46:30.000 | |12 |4258 |2024-06-17T09:00:30.000 | |13 |3418 |2024-06-17T09:14:30.000 | |14 |1918 |2024-06-17T09:39:30.000 | |15 |2429 |2024-06-17T09:30:59.000 | Query terminated ksql> print result7777; Key format: AVRO or KAFKA_STRING Value format: AVRO rowtime: 2024/06/16 04:23:23.878 Z, key: 1, value: {"CALCULATED_TIME": 12183, "LAST_LOG_TIME": 1718541000000}, partition: 0 rowtime: 2024/06/16 04:23:23.879 Z, key: 2, value: {"CALCULATED_TIME": 4083, "LAST_LOG_TIME": 1718549100000}, partition: 0 rowtime: 2024/06/16 05:10:08.498 Z, key: 3, value: {"CALCULATED_TIME": 6183, "LAST_LOG_TIME": 1718547000000}, partition: 0 rowtime: 2024/06/16 06:06:52.365 Z, key: 4, value: {"CALCULATED_TIME": 32673183, "LAST_LOG_TIME": 1685880000000}, partition: 0 rowtime: 2024/06/16 06:06:52.373 Z, key: 5, value: {"CALCULATED_TIME": 32571183, "LAST_LOG_TIME": 1685982000000}, partition: 0 rowtime: 2024/06/16 06:06:52.377 Z, key: 6, value: {"CALCULATED_TIME": 32501883, "LAST_LOG_TIME": 1686051300000}, partition: 0 rowtime: 2024/06/16 06:09:36.530 Z, key: 7, value: {"CALCULATED_TIME": 3153, "LAST_LOG_TIME": 1718550030000}, partition: 0 rowtime: 2024/06/16 06:15:08.351 Z, key: 8, value: {"CALCULATED_TIME": 2793, "LAST_LOG_TIME": 1718550390000}, partition: 0 rowtime: 2024/06/16 06:41:28.920 Z, key: 9, value: {"CALCULATED_TIME": 1053, "LAST_LOG_TIME": 1718552130000}, partition: 0 rowtime: 2024/06/17 00:23:09.442 Z, key: 12, value: {"CALCULATED_TIME": 1372, "LAST_LOG_TIME": 1718614830000}, partition: 0 1-9, 12 이미 10분이 지난 데이터 // 그 외 = 데이터가 mysql에 담기고 10분이 지나 table에 담긴 데이터

  • kafka
  • 데이터-엔지니어링
  • ksqldb
행복한 족제비 댓글 1 좋아요 0 조회수 245

auto_commit_interval_ms_config 질문

미해결

[아파치 카프카 애플리케이션 프로그래밍] 개념부터 컨슈머, 프로듀서, 커넥트, 스트림즈까지!

- 카프카를 공부하시면서 생긴 질문들을 남겨주세요. 상세히 작성하면 더 좋아요! - 먼저 유사한 질문이 있었는지 검색해보세요. - 서로 예의를 지키며 존중하는 문화를 만들어가요. - 잠깐! 인프런 서비스 운영 관련 문의는 1:1 문의하기를 이용해주세요. 안녕하세요~ auto_commit_interval_ms_config 에 대해 궁금한 점이 있는데요 찾아봐도 모호해서 질문드립니다. auto_commit_interval_ms_config = 60 이라고 가정했을때 위 옵션은 poll() 호출 여부와 관계없이 60초 마다 자동으로 커밋을 해주는건가요? 아니면 마지막 자동커밋 발생하고 60초 이후에 poll() 이 호출될때 커밋을 해준다는건가요?

  • kafka
  • 데이터-엔지니어링
hello 댓글 2 좋아요 0 조회수 246

MySQL 실습

미해결

Database - SQL

CUSTOMER ID FORMATTING - 1: 00001 - 2: 00002 - 13: 00013 SELECT CUSTOMERID, CONCAT(REPEAT('0', 5-LENGTH(CUSTOMERID)), CUSTOMERID) FROM CUSTOMER; MySQL은 문자열 + 하기 연산이 없어서 CONCAT 함수를 사용해야 합니다

  • sql
  • 데이터-엔지니어링
bae jewoo 댓글 1 좋아요 0 조회수 259

강의 질문

미해결

카프카 완벽 가이드 - 코어편

제가 EXCEL파일에 있는 데이터를 카프카를 통해 db에 저장을 해야하는데 이 강의를 들으면 할 수 있을까요?

  • kafka
  • 데이터-엔지니어링
민영 댓글 2 좋아요 0 조회수 238

debezium에서 ksqldb로

해결됨

카프카 완벽 가이드 - ksqlDB

제가 구상하고있는 구조가 mysql에서 debezium source connector가 topic에 넘기고 ksqldb의 streams나 table로 재구성하여 다른 topic으로 넘긴 후 mysql sink database에서 받는다. 라는걸 구상중인데요 ksqldb에서 직접 insert를 하면 json 형식이 아니라서 sink connector가 읽지 못하는거 같습니다. -- debezium.json -- { "name": "debezium", "config": { "connector.class": "io.debezium.connector.mysql.MySqlConnector", "tasks.max": "1", "database.hostname": "localhost", "database.port": "3306", "database.user": "root", "database.password": "1234", "database.allowPublicKeyRetrieval": "true", "database.server.id": "10777", "database.server.name": "debe01", "database.include.list": "debe", "table.include.list": "debe.user", "database.history.kafka.bootstrap.servers": "localhost:9092", "database.history.kafka.topic": "schema-changesde.mysql.oc", "key.converter": "org.apache.kafka.connect.json.JsonConverter", "value.converter": "org.apache.kafka.connect.json.JsonConverter", "key.converter.schemas.enable": "false", "value.converter.schemas.enable": "false", "database.connectionTimeZone": "Asia/Seoul", "time.precision.mode": "connect", "transforms": "unwrap", "transforms.unwrap.type": "io.debezium.transforms.ExtractNewRecordState", "transforms.unwrap.drop.tombstones": "false" } } 그래서 debezium으로 mysql의 data를 읽어서 topic으로 가져왔는데 ksqldb에서 그 data를 읽는 부분에서 막혔습니다 강의에 나온거처럼 ksqldb와 debezium을 연동을 해야 가능한건가요? 아니면 어떤 방법이 있을까요?

  • kafka
  • 데이터-엔지니어링
  • ksqldb
행복한 족제비 댓글 2 좋아요 0 조회수 286

Docker Volume 오류(reference, lowercase)

미해결

따라하며 배우는 도커와 CI환경 [2023.11 업데이트]

#ERROR1 repository 이름이 소문자여야 한다는 에러입니다. 제가 폴더 명을 "Docker"로 해놨었더니 이런 오류가 뜨더라고요. 폴더명을 "docker"로 바꿨더니 해결되었습니다. kim-yaegun@gim-yegeons-MacBook-Air Docker % docker run -p 5001:8080 -v /usr/src/app/node_modules -v $(pwd):/usr/src/app yaegun/node docker: invalid reference format: repository name (Docker) must be lowercase. See 'docker run --help'. #ERROR2 레퍼런스가 유효하지 않다는 에러입니다. kim-yaegun@gim-yegeons-MacBook-Air docker % docker run -p 5001:8000 -v /usr/src/app/node_modules -v $(pwd):/usr/src/app yaegunkim/node docker: invalid reference format. See 'docker run --help'. 이건 $(pwd) 를 "$(pwd)" 로 바꾸어 주니 해결되었습니다. kim-yaegun@gim-yegeons-MacBook-Air docker % docker run -p 5001:8000 -v /usr/src/app/node_modules -v "$(pwd)":/usr/src/app yaegunkim/node Successful

  • aws
  • docker
  • github
  • ci/cd
  • travis-ci
  • 데이터-엔지니어링
Yaegun Kim 댓글 1 좋아요 0 조회수 610

[섹션3 - 내가 만든 이미지 기억하기 쉬운 이름 주기] 네이밍/태그 에러

미해결

따라하며 배우는 도커와 CI환경 [2023.11 업데이트]

"docker build -t YaegunKim/hello:latest ./"로 빌드를 잘 한 것 같은데 아래와 같은 에러가 나오더라고요. #COMMAND docker run -it YaegunKim/hello #ERROR Unable to find image 'YaegunKim/hello:latest' locally docker: Error response from daemon: Get "https://YaegunKim/v2/": dialing YaegunKim:443 container via direct connection because has no HTTPS proxy: resolving host YaegunKim: lookup YaegunKim: no such host. See 'docker run --help'. 근데 또 아이디로 run을 하면 잘 되고... #PROBLEM-SOLVING 이유는 버전은 "latest"가 아닌 "lastest"로 해서 에러가 났던 것이었습니다. 다시 빌드 하고 실행해보니 hello가 잘 출력되네요 ㅎㅎ

  • aws
  • docker
  • github
  • ci/cd
  • travis-ci
  • 데이터-엔지니어링
Yaegun Kim 댓글 1 좋아요 0 조회수 255

도커를 사용하지 않는 방법

미해결

Airflow 마스터 클래스

안녕하세요 HPC를 사용하고 있는데 도커가 사용 불가능한 HPC라 우선은 구글링하여 airflow를 설치하고 강의를 듣고 있습니다. 아직 1강인데, 혹시 차후에 도커가 없어서 강의를 못따라가는 상황이 생길까요? 수강신청전에 미리 확인해봤어야 했는데 죄송합니다 ㅜㅜ!

  • python
  • 데이터-엔지니어링
  • airflow
Lim 댓글 1 좋아요 0 조회수 333

from airflow.sensors.sql import SqlSensor에 대해 질문 있습니다.

미해결

실리콘밸리 엔지니어와 함께하는 Apache Airflow

선생님이 4:21초에 from airflow.sensors.sql import SqlSensor 는 provider에 있는게 아니라 core에 있는 sensor라고 알려주셨는데 airflow 버전 2.9.1에서는 SqlSensor 가 apache-airflow-providers-common-sql 패키지에 포함되어 있다고 하는데 그러면 버전 2.9.1에서는 airflow core에 있는 sensor를 사용하지 못하는 건가요??

  • python
  • 빅데이터
  • 데이터-엔지니어링
  • airflow
코딩딩 댓글 1 좋아요 1 조회수 279

tail -f flume-cmf-flume-AGENT-server02.hadoop.com.log 오류

미해결

15일간의 빅데이터 파일럿 프로젝트

tail -f flume-cmf-flume-AGENT-server02.hadoop.co m.log 했을때 Creating이나 강의에 말씀한 내용 나오지않고, 아래처럼 나오기만 하는데 Flume Config파일도 정상적이고 재시동도 해봤는데 안되는데 또 조치해야할게 있을까요?

  • 빅데이터
  • hadoop
  • kafka
  • zookeeper
  • redis
  • flume
  • impala
  • 데이터-엔지니어링
김태욱 댓글 2 좋아요 0 조회수 293

CLI로 실행과 코드로 실행하면 결과가 다르게 나옵니다

해결됨

카프카 완벽 가이드 - ksqlDB

CREATE STREAM add_stream WITH (KAFKA_TOPIC='column_stream_topic', VALUE_FORMAT='JSON') AS SELECT *, CAST(NULL AS INT) AS new_column FROM test_stream EMIT CHANGES; 이렇게 기존 test_stream에서 column을 추가한 add_stream을 만들려고 CLI문을 실행시키면 원래 test_stream에 담겨있는 data가 담아져서 나오는데 package com.example.service; import io.confluent.ksql.api.client.Client; import io.confluent.ksql.api.client.ClientOptions; import io.confluent.ksql.api.client.ExecuteStatementResult; import org.springframework.beans.factory.annotation.Value; import org.springframework.stereotype.Service; import javax.annotation.PostConstruct; import java.util.concurrent.ExecutionException; @Service public class streamPracticeAdd { @Value("${ksqldb.server.host}") private String ksqlDbHost; private int ksqlDbPort; private Client client; @PostConstruct public void init() { ClientOptions options = ClientOptions.create() .setHost(ksqlDbHost) .setPort(ksqlDbPort); client = Client.create(options); } public void streamsAdd(String columnName, String dataType) { String createStreamKsql = "CREATE STREAM add_stream WITH (KAFKA_TOPIC='column_stream_topic', VALUE_FORMAT='JSON') AS SELECT *, CAST(NULL AS " + dataType + ") AS " + columnName + " FROM test_stream EMIT CHANGES;"; try { ExecuteStatementResult result = client.executeStatement(createStreamKsql).get(); System.out.println("Stream created and data inserted into new topic: " + result.queryId()); } catch (InterruptedException | ExecutionException e) { e.printStackTrace(); } } } /kafka/addColumn/new_column/INT 인 API 요청을 줘서 새 stream을 만드는 코드인데 실행시키면 기존 column에 새 column까지 추가는 되는데 기존 data가 하나도 들어오지 않습니다. 검색을 해봤는데도 잘 안나와서 질문 남깁니다 감사합니다.

  • kafka
  • 데이터-엔지니어링
  • ksqldb
행복한 족제비 댓글 1 좋아요 1 조회수 198

선생님 도메인이란게 뭔가요???

미해결

데이터베이스 중급(Modeling)

데이터베이스에서 말하는 도메인이란 어떤것을 뜻하나요?? 구글링을 해봐도 이해를 잘 못하겠어요 ㅠㅠ

  • dbms/rdbms
  • 데이터-엔지니어링
service 댓글 3 좋아요 0 조회수 491

컨슈머 리벨런싱 도중 에러시 session.timeout.ms 관련 질문

미해결

카프카 완벽 가이드 - 코어편

컨슈머 리벨런싱 도중에 cpu 과부하 같은 오류가 발생해서 리벨런싱이 완료되지 않은 경우 heartbeat.interval.ms 설정은 컨슈머가 안붙었기 때문에 보내지 못하고 session.timeout.ms 설정 값을 통해서 그룹 코디네이터가 컨슈머가 죽었다고 판단해서 리벨런싱이 일어나야 할 것 같은데 --describe 컨슈머 그룹 상태를 확인했을 때 계속 Consumer group '그룹이름' has no active members. 같이 컨슈머가 안붙는다면 서버 재시작을 통해서 강제 리벨런싱을 일어나게 하면 다시 컨슈머가 붙어서 해결이 가능하지만 이 방법을 떠나서 session.timeout.ms 같은 값을 통해서 자동 리벨런싱이 일어나지 않을 수도 있는건지 궁금합니다!

  • kafka
  • 데이터-엔지니어링
밥밥 댓글 1 좋아요 0 조회수 182

재설치 후 커넥트 실행 오류

미해결

카프카 완벽 가이드 - 커넥트(Connect) 편

안녕하세요. 저번에 카프카 재기동 오류에 관해 질문을 올렸던 수강생입니다. 카프카 실행에 관한 오류는 해결하였습니다만, 이번에는 connector가 실행되지 않는 오류가 발생하여 강사님 말씀대로 카프카 삭제 후 강의와 동일한 버전으로 재설치해보았습니다. 하지만 커넥터는 계속 똑같이 실행되지 않고 있습니다.. 아래는 connect_start_ log.sh 입력 후 출력되는 로그 내용입니다. ... 이 뒤로는 Retrying to fetch metadata만 반복적으로 출력됩니다. 끝없는 오류의 굴레에서 벗어나고 싶습니다.. 제발 도와주세요

  • kafka
  • 데이터-엔지니어링
ytnam1 댓글 2 좋아요 0 조회수 228

카프카 스트림즈 관련해 질문있습니다.

미해결

[아파치 카프카 애플리케이션 프로그래밍] 개념부터 컨슈머, 프로듀서, 커넥트, 스트림즈까지!

안녕하세요 강의 막마지 수강중인대요 topic에서 데이터를 가져와 가공을 한 뒤 다른 topic에(싱크프로세서) 데이터를 저장할 때 스트림즈를 사용하면 좋다고 강의를 통해 알게는 되었는대요 궁금한점은 topic 데이터를 가져와 처리후 다른 토픽이 아닌 db같은 곳에 데이터를 저장할 수도 있잖아요? 그런경우는 스트림즈를 사용하지 않나요? 위와 같은 흐름이 필요한대 그럴경우 어떻게 구성하는게 좋은가요? 스트림즈로 데이터를 처리해 다른 토픽에 넣고 커넥트를 사용해 그 토픽에서 db로 저장하도록 구현하는게 좋을지 스트림을 통해 db까지 저장할 수 있는건지 궁금합니다 추가로, 데이터 가공시에 스트림즈에서 외부 db에서 데이터를 조회해서 가공하도록 해도 괜찮은가요?

  • kafka
  • 데이터-엔지니어링
황영롱 댓글 2 좋아요 0 조회수 192

Schemaless 특성을 재생시 검은화면이 나와요

미해결

mongoDB 기초부터 실무까지(feat. Node.js)

Schemaless 특성을 재생시 검은화면이 나와요 새로고침해도 같은 현상이 나오네요 ㅠ

  • javascript
  • node.js
  • aws
  • mongodb
  • rest-api
  • dbms/rdbms
  • 데이터-엔지니어링
재혁최 댓글 1 좋아요 0 조회수 274

3가지의 머신 러닝 타입 살펴보기 챕터가 재생되지 않습니다.

해결됨

[멘토링] 데이터로 미래를 그리다: 모두를 위한 데이터 리터러시

많은 질문 부탁드립니다. 상세히 작성해주시면 더 좋습니다. 단 앞서 비슷한 질문이 있었는지 검색 부탁드리겠습니다. 서비스 운영 관련 문의는 1:1 문의하기를 이용 부탁드리겠습니다.

  • EDA
  • 데이터-엔지니어링
  • 데이터-리터러시
  • 데이터-트랜스포메이션
박준용 댓글 1 좋아요 0 조회수 242

FileZilla 권한 거부

미해결

15일간의 빅데이터 파일럿 프로젝트

강사님하신대로 빠른연결하면 home/bigdata가 아닌 /로 들어가지고 home을 눌러서 bigdata로 들어가려해도 권한 수정되어있는데 제가 뭔가 빠뜨린건가요? bigdata 권한 수정해주면 될 것 같긴한데 추후에 문제가 생길까봐 문의드립니다.

  • 빅데이터
  • hadoop
  • kafka
  • zookeeper
  • redis
  • flume
  • impala
  • 데이터-엔지니어링
김태욱 댓글 1 좋아요 0 조회수 212

5. Cloudera Manager 구성 시 오류

미해결

15일간의 빅데이터 파일럿 프로젝트

강의와 똑같이 설정하고 돌렸는데 위와 같은 오류들이 발생하는데 해결 방법을 모르곗습니다 ㅠㅜ

  • 빅데이터
  • hadoop
  • kafka
  • zookeeper
  • redis
  • flume
  • impala
  • 데이터-엔지니어링
김태욱 댓글 1 좋아요 0 조회수 335

인기 태그

인프런 TOP Writers

주간 인기글