청크 단위로 트랜잭션 된다는건 이해했다. 그에 관련해서 궁금증이 생겼는데, reader, processor에서 처리하다가 Exception이 나도 사실 DB엔 롤백할게 없으니 사실상 Writer 작업 중에만 단 한번 롤백이 수행될 것이라고 예상되는데 맞는가? read 시에, process 도중에도 롤백이 일어날 경우가 있는지 궁금하다. 추가로 과거 스프링 배치 공식 문서의 잘못된 다이어그램 이라던지 null을 줘야 끝난다는 점과 97개 와 같이 자세한 예시를 들어준 점, read(), process()가 각각 10번씩 수행된다는 것과 같이 사용자들이 많이 헷갈려 하는걸 명확하게 알려줘서 좋은 것 같다.
앞선 질문에 대한 답변 고맙다 미스터 KILL-9 덕분에 손쉽게 엑셀을 처형 (처리)할 수 있었지 하지만 그 다음 관문이 존재하는군 후후.. 각 STEP 마다 RepeatStatus 에 따라서 트랜잭션이 보장하는건 이해했다 하지만 여러 관계가 존재하는 테이블 데이터 적재 시 트랜잭션을 어떻게 보장할지 감이 안온다 미스터 KILL-9 예를 들어 설명하지.. FILE-A, FILE-B 각각 다른 컬럼을 가진 파일들이지 FILE-A는 TABLE-A에 적재하고 FILE-B는 TABLE-B에 적재한다 각 FILE 당 ROW 100개씩 읽으면서 적재하고 문제가 생기면 해당 100건만 롤백할텐데 문제는 TABLE-A 와 TABLE-B의 관계다 TABLE-A 가 부모고 TABLE-B자 자식 테이블인 상황에서 특정 TABLE-B 데이터 롤백 시 TABLE-A 데이터도 마찬가지로 롤백 해야할거 같은데 이런 경우 어떻게 원자성을 보장할 수 있는가에 답변할 수 있겠는가..? 현재 내가 떠오른 방안은 결국은 모든 데이터 처리이니 특정 부분 처리 실패하면 데드 DLQ (Dead Letter Queue) 에 담아서 나중에 처형( 처리)하도록 해야하나 싶다!
Spring Boot + Kotlin + java 21로 진행중이다. 먼저 좋은 강의 너무 고맙고, 나도 다른 사람의 Q&A 처럼 BatchConfig가 있어서 수행시에 부트만 떴다가 꺼지고 아무것도 출력되지 않아서 당황했다 (그래서 강의 자료에 더이상 불필요하다 보다는 제거하라고 명시하면 좋을 것 같다) 질문이 있는데 1. BatchConfig가 있고 없고가 어떤 것 때문에 수행결과에 차이점을 주는거야? 2. Kotlin을 사용한 Spring Boot에서는 @Import를 사용하지 않았는데, 이때도 자동으로 설정을 해주는걸까? BatchConfig가 있다는 것 자체로 배치 수행은 안하고 부트가 바로 끝나버려 두 질문 다 그냥 궁금증일 뿐이다. BatchConfig를 제거하면 수행에는 문제가 없다.
문제2를 풀다가 보니, 초기 데이터프레임 상태에서 1. 주어진 데이터에서 결측치가 30%이상 되는 컬럼을 찾고 해당 컬럼에 결측치가 있는 데이터(행)을 삭제함. --> 1 번 문제를 처리하고나면, 전체적인 결측치 상태가 달라집니다. 2. 그리고 30% 미만, 20%이상인 결측치가 있는 컬럼은 최빈값으로 대체하고 1번 처리하고 난 후 2번 문제에 해당하는 조건의 컬럼은 없게 되는데, 이런 경우 1번 처리된 결과가 아닌 초기 데이터프레임 상태에 대해 문제를 풀어야 하는거죠? 선생님 풀이도 초기 상태를 고려하여 풀이된 것 같습니다. 시험에서도 이렇게 하면 되는거죠?
한 번에 끝내는 AI 에이전트 개발 올인원 (w. LangGraph, Google ADK, CrewAI)
4강에서, 제공해주신 환경파일을 복사한 후 "uv sync"를 실행하면 다음과 같은 에러가 발생합니다. 에러메세지에 따라 MSVC Build Tool도 다운받아 설치하였지만 동일한 에러가 반복됩니다. 현재 python version이 3.13.7을 사용하고 있습니다. == 에러 메세지 == C:\Proj\agent-atoz\1-1_chatbot_agent>uv sync Using CPython 3.13.7 interpreter at: C:\Python\Python313\python.exe Creating virtual environment at: .venv Resolved 221 packages in 1ms × Failed to build chroma-hnswlib==0.7.6 ├─ ▶ The build backend returned an error ╰─ ▶ Call to setuptools.build_meta.build_wheel failed (exit code: 1) [stdout] running bdist_wheel running build running build_ext building 'hnswlib' extension [stderr] error: Microsoft Visual C++ 14.0 or greater is required. Get it with "Microsoft C++ Build Tools": https://visualstudio.microsoft.com/visual-cpp-build-tools/ hint: This usually indicates a problem with the package or the build environment. help: chroma-hnswlib (v0.7.6) was included because agent-a-to-z (v0.1.0) depends on crewai (v0.177.0) which depends on chromadb (v0.5.23) which depends on chroma-hnswlib
[색션3. 작업형1 판다스]의 Section9. 데이터 추가/변경에서 행을 추가할 때는 df .loc[...] 이용해서 하는데 Section5. 새로운 컬럼(열) 추가에서는 그냥 df ['new'] = .... 로 추가를 하더라구요. 이 둘의 차이가 있을까요? 제가 이해한 것은 열을 추가할 때는 df ['new'] = 또는 df.loc[ , 'new'] = 행을 추가할 때는 df.loc['new'] = 이렇게 쓸 수 있고 loc를 사용하면 각각의 데이터를 넣을 수 있지만, 사용하지 않는 경우(Section5)는 일괄적으로 같은 값이 들어간다..인데 맞는지 궁금합니다!
import time from concurrent import futures WORK_LIST = [1000000, 10000000, 100000000, 1000000000] def sum_number(n): return sum(range(1, n + 1)) def main(): start_time = time.time() futures_list = [] with futures.ThreadPoolExecutor() as excecutor: for work in WORK_LIST: future = excecutor.submit(sum_number, work) futures_list.append(future) print(f"Schduled Work: {work} | {future}") print() result = futures.wait(futures_list, timeout=5.0) print(result) end_time = time.time() - start_time print(f"Excecute Time: {end_time:.2f}s / Result: {result}") if __name__ == '__main__': main() 현재 문제점은 최종 출력 시간이 12초정도 걸리는데 중간에 5초 wait 후 print(result)가 호출되는 것이 아니라 12초 후에 아래 코드가 실행될 때 함께 실행되며 모두 정상적으로 finished returned int로 나옵니다. print(f"Excecute Time: {end_time:.2f}s / Result: {result}") 터미널 출력 결과: DoneAndNotDoneFutures(done={<Future at 0x2545b19e780 state=finished returned int>, <Future at 0x2545b123b10 state=finished returned int>, <Future at 0x2545b16f230 state=finished returned int>, <Future at 0x2545b123390 state=finished returned int>}, not_done=set()) Excecute Time: 11.80s / Result: DoneAndNotDoneFutures(done={<Future at 0x2545b19e780 state=finished returned int>, <Future at 0x2545b123b10 state=finished returned int>, <Future at 0x2545b16f230 state=finished returned int>, <Future at 0x2545b123390 state=finished returned int>}, not_done=set())
킬구형 안녕 FlatFileReader 라는 아주 편안한 기능은 존재하는데 어째서 ExcelFileReader 기능은 존재하지 않는거지? gpt 말로는 공식 확장 모듈은 spring-batch-excel 이 존재한다고는 하는데 이거 믿고 사용해도 되는지 모르겠네 킬구형은 excel 파일 읽고 DB에 쓸 때 아파치 poi 라이브러리로 직접 파싱해?