inflearn logo
강의

Khóa học

Chia sẻ kiến thức

Lập trình CUDA (4) - Tính toán song song C/C++/GPU - Nhân ma trận matrix

cách tiếp cận lát gạch 22-4 - cách tiếp cận lát gạch

kernelMatCpy에서는 __syncthreads가 필요없지 않나요

Đã giải quyết

245

javer965697

1 câu hỏi đã được viết

0

제목 그대로 kernelMatCpy에서는 각 스레드 작업이 다른 스레드에 영향을 주지 않기 때문에 필요없을 것 같은데요. 실제로 __stncthreads()를 제거하고 돌려봐도 정상적으로 결과가 나오구요.
혹시 이런 경우라도 내부적으로 꼬일 수 있어서 사용하신 것인지 아니면 대부분의 shared memory로 복사해서 쓰는 경우에 필요하기 때문에 습관(?)차원에서 사용하신 것인지 궁금합니다.

c c++ cuda gpu 병렬-처리

Câu trả lời 1

1

onemoresipofcoffee

안녕하세요.

해당 부분에서는 "습관"으로 생각하시면 되겠습니다.

많은 경우에, kernel 실행 후에, 다른 kernel 이 연달아 실행되거나, 말씀하신 대로, shared memory 에서 즉시 사용하거나 하는 경우가 많아서, 보통 습관적으로 sync threads 를 하는 편입니다.

꼼꼼하게 따져보면, 예제 프로그램에서는 불필요한 경우가 가끔 있습니다. 참고하십시오.

감사합니다.

삼성 코테 없어짐

0

8

0

섹션7에서 개념적 궁금증

0

6

0

26년2회 실기기출은 언제쯤...

0

27

2

이론 공부법 요약본 버전 업데이트 문의

0

24

2

코딩살구클럽 가입부탁드립니다

0

29

2

vs 디버그 옵션 설정

0

26

2

코딩살구클럽 가입 요청 확인부탁드립니다

0

31

2

54강 양자화의 끝판왕, 터보퀀트 (예정) 강의 업로드

0

30

1

블로그에 학습 내용 올려도 되나요?

0

33

1

5-S 테스트 케이스 질문

0

36

2

정처기 필기 준비할때 이 이론을 다시 외워도 될까요?

0

55

2

코살 문제풀이 환경

0

49

2

2 - T 오큰수 문제가 있는 것 같습니다.

0

43

1

추천 추가문제들

0

43

2

프로그래머스 코테 환경 관련해서 질문드립니다.

0

48

2

최댓값 구하기(서바이벌)에서 수식 구성에 대한 질문

0

42

2

자료 한번에 다운받기

0

32

1

해당 문제에 대한 채점이 코딩살구클럽에서 올바르게 처리되지 않습니다.

0

44

2

균형 이진 트리 설명 시 높이 숫자

0

32

2

4-H 질문드립니다.

0

36

2

24-2 3중 for loop 개선책 이해가 가지 않습니다.

0

153

2

transpose-shared.cu 가 느린 이유에 대해서 질문 있습니다.

0

160

2

소스 코드 에러 문의 드립니다

0

363

1

global memory를 사용한 matrix copy 대비 global memory를 활용한 matrix transpose가 속도가 느린 이유가 궁금합니다.

0

384

1