안녕하세요. '비전 트랜스포머-최신 모델' 강의 11:36 근처 슬라이드를 기준으로 질문드리겠습니다. (사실 그 이후부터 계속 지속적으로 차원 혼동이 있는 것 같아서, 하나를 기준삼아서 질문드리면 나머지가 저절로 해결될 것 같습니다.) p=(size of patch)로 정의를 하고 사진을 N개로 쪼갠다고 가정했을 때, 그것을 flatten시켜준 각각의 벡터들, (x_{p}^{i}, i=1,...,N)이라고 가정했을 때, 해당 벡터는 P^2*C 차원의 벡터들이 되는 거잖아요? 그렇다면, 그 N개의 벡터들을 concatenate하여 행렬 x_p를 구축했을 때, 그 차원은 (P^2*C) by N이 되어야 하는게 아닌가요? 이 이후부터 슬라이드에서는 가로와 세로가 뒤바뀌어 있는 것 같은데 뭐 실전에서는 transpose하면 되는 문제긴 하지만 나름대로 엄청나게 궁금해져서 질문을 드려봅니다. 설명을 해주신거나 그림을 그려주시는 것은 모두 x_{p}^{i}가 열벡터이고 concatenate를 하실 때 row-wise가 아니라 column-wise로 합치신 것 같아서 그렇게 생각이 들었습니다.
1분 쯤에 나오는 표에서 conf는 임계치가 아닌 confidence score를 나타냅니다. 그런데 강의 내용과 오른쪽 P-R curve는 conf를 임계치로 생각하고 말씀을 해주시는데, 제가 헷갈린건지 아니면 오류가 있는건지 알려주실 수 있으실까요? 😀 또 헷갈리는게 있는데, 만약 AP를 계산할 때 IoU 임계값에 따른다고 하면 confidence 임계 값은 고정을 하고 계산하는거겠죠? 그렇다면 논문 마다 mAP를 계산하는 방식이 다른데 이는 논문에서 계산방법을 보통 알려주나요?
안녕하세요! 강의에서 Precision-Recall를 구할 때 Confidence score를 기준으로 내리차순 한 뒤 P, R을 구하는 방법을 알려주셨습니다. 근데 실제 구현에서는 바로 tp,fp,tn,fn 을 구한 뒤 P,R을 구하는게 훨씬 빠를 것 같은데 해당 방식은 왜 나온건가요? 사람이 직접 구할 때 조금 더 직관적으로 보기 위해서 사용하는 방식인가요?
1.q와 k를 내적 하는 이유가 궁금합니다. 이는 입력의 유사도 행렬을 얻기 위함으로 알고 있습니다. 그렇다면 q와 k가 아닌 q와 q의 트랜스포즈로 내적하면 안되는걸까요? 음 ...업데이트 할때 q와 k가 비슷하게 학습되었다는 가정을 가지고 내적 한걸까요? 2.그리고 Multi Head와 그냥 Self attention의 차이가 궁금합니다. 별도의 파라미터로 학습되기때문에 하나일때보다 많은 관점이 녹아있다고 생각하면 될까요? 3.다른 댓글에서 코드A@V가 리니어 라고 하셨는데요 PPT에서는 SA(z)=Av와 [SA1(z)...]Umsa가 따로 있습니다. 코드에서는 A@V만 있는데 어떻게 연결지어서 봐야 할지 잘 모르겠습니다.
선생님 안녕하세요. mm_faster_rcnn_train_coco_bccd.ipynb 코드 실행하다가 오류가 발생해서 해결방법을 모르겠어서 질문남깁니다.. 코드는 수정한건 없고 그대로 실행하였습니다. 버전도 통일했는데, 해당오류가 발생해서 혹시 해결방법을 알 수 있을까요? 감사합니다
안녕하세요 선생님 저는 주피터노트북으로 선생님 코드를 따라 실습해보고 있습니다. !wget -O /content/pretrained/yolov3.cfg https://github.com/pjreddie/darknet/blob/master/cfg/yolov3.cfg?raw=true 위와 같이 파일을 wget으로 다운로드 받을 때 마다 wget.download (다운경로, 저장경로)로 구현하고 있었는데요. raw=True에 대해서는 주피터노트북으로 어떻게 구현할 수 있을까요?
안녕하세요! 평소 파이썬 공부를 하다가 헷갈렸던 부분이 있는데, 경로를 설정할 때 ./과 /의 차이에 대해서 알 수 있을까요? cv2_image = cv2.imread('./content/data/beatles01.jpg') cv2_image = cv2.imread('/content/data/beatles01.jpg')
안녕하세요, 강의 잘 듣고 있습니다. train_detector(model, datasets, cfg, distributed=False, validate=True) 실행 시키면, BrokenPipeError : [Errno 32] Broken pipe에러가 발생 하는데.. 이유를 잘 모르겠습니다 ㅜ
!python train.py \ --training_data_path="./data/ICDAR2015/train_data/" \ --checkpoint_path="/content/drive/MyDrive/Colab Notebooks/east_resnet_50_rbox" python3: can't open file '/content/train.py': [Errno 2] No such file or directory 위 코드에 대해 자꾸 에러가 생기는데 해결방법을 알고 싶습니다
안녕하세요. object_detection을 로컬 패키지로 잡지않고, 설치한다고 하셨습니다. 그래서 DLCV/Detection/tensor_api/models/research$의 setup.py를 python setup.py install 하라고 하셨는데, setup.py가 현재는 없는것 같습니다. 그래서, model_builder_test.py를 python으로 컴파일 하면 No moduled .... object detection이 나옵니다. 현재는 내용이 조금 바뀐것 같은데 방법이 없을까요?
안녕하세요 수강생입니다. https://drive.google.com/file/d/1eeCo0WKkh1t0v6o_4lIOhR59SzKYUoX9/view?usp=share_link 해당 링크에서 데이터셋을 다운받을 수 있다고 말씀주셨는데, 이 공유된 데이터셋에서는 3DHPE/datasets/data_2d_golfswing.npz, 3DHPE/datasets/data_2d_h36m_cpn_conf.npz 파일이 존재하지 않습니다. 위의 두 실습 데이터셋은 어디서 받을 수 있을까요?
좋은 강의 찍어주셔서 감사합니다. 해당 강의를 토대로 공부를 하며 모델을 제작 중에 학습 후 inference_detector을 돌리고 나면 같은 물체를 여러번 잡는 문제가 발생합니다. 또한 이용중인 이미지의 크기가 작아서 인지 엥커박스의 크기가 전체 화면을 잡아주는 경우가 발생하고 있습니다. 그래서 이를 방지하고자 rpn_head의 anchor_generator를 수정해보았으나 학습이 안되는 모습을 관찰하였습니다. 사용 모델 : faster_rcnn_r50_caffe_fpn_mstrain_3x_coco.py 이때 사용 이미지의 class는 1개였습니다. 어떤 식으로 이것을 수정할 수 있을까요? 또한 어디 부분의 강의를 들었을 때 이와 관련된 내용을 알 수 있을까요? 감사합니다.