inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

AI 디자이너 입문: 이미지·영상 제작부터 자동화까지, ComfyUI + n8n

로컬 PC에 ComfyUI 설치하고 Manager까지 한 번에 세팅하기

영상을 이어 붙이는 방법을 알고 싶어요.

해결된 질문

54

제주삼다

작성한 질문수 2

0

남박사 강사님께서 만든 영상 이어 붙인 과정도 내용이 있었으면하는데 ㅠ 어떻게 이어붙인지 과정을 잘모르겟네요. 나름 일관성있는 영상처럼 보여서요.


예를들어 ACE Step 1.5 를 사용하여 2분짜리 음악을 만들었다고 하였을 때, 캐릭터 시트를 사용하여 자연스러운 2분 뮤직비디오 같은건 어떻게 만들 수 있는지. 궁금합니다

python 웹-디자인 디자인-시스템 n8n ai-agent comfyui ai-이미지

답변 1

0

남박사

안녕하세요, 제주삼다님.

제가 만든 영상이라는 게 강의 소개에 사용된 뉴스 앵커 영상을 말씀하시는 거겠죠?

지금은 정확하게 100% 기억이 나지는 않지만, 기억을 더듬어 말씀드리면 우선 최초에 뉴스 화면 형태의 기준 이미지 1장을 먼저 생성했습니다. 그리고 그 이미지를 바탕으로 Qwen Edit의 카메라 LoRA(강의에서 사용한 LoRA)와 GPT-Image-2를 사용해서 다양한 카메라 각도의 이미지를 추가로 생성했습니다.

이 과정에서는 특히 화질 저하와 인물의 일관성 유지 여부를 많이 확인했습니다. 같은 인물이라도 각도나 구도를 바꾸는 과정에서 얼굴, 헤어스타일, 의상, 전체적인 분위기가 조금씩 달라지는 경우가 있었기 때문에 실제 영상에 사용할 이미지보다 훨씬 많은 후보 이미지를 생성했습니다. 기억으로는 실제 사용된 이미지 수의 5배 이상은 생성했던 것 같습니다. 그중에서 화질과 인물 일관성이 가장 잘 유지된 이미지들만 골라서 최종 영상에 사용했습니다.

대본은 ChatGPT를 사용해서 기본 스크립트를 만든 뒤 제가 직접 수정했고, 이 스크립트를 바탕으로 오디오는 MiniMax를 사용해서 생성했습니다. 그리고 영상에 사용한 목소리도 기존 음성을 복제한 것이 아니라 MiniMax의 Sound Design 기능을 통해 생성한 목소리입니다.

그다음 전체 오디오를 적절한 길이로 나누고, 각 구간에 맞춰 앞에서 생성해 둔 이미지들을 시작 이미지로 사용하여 LTX 2.3 모델로 각각의 영상 클립을 생성했습니다.

최종적으로는 생성된 영상 클립들을 After Effects 같은 외부 편집 프로그램에서 이어 붙이고, 자막을 입히고, 필요한 첨부 자료를 오버레이해서 완성했습니다. 물론 단순히 영상 클립만 연결하는 정도라면 굳이 After Effects 같은 프로그램이 꼭 필요한 것은 아니고, FFmpeg나 일반 영상 편집 프로그램만으로도 충분히 가능합니다.

질문하신 것처럼 ACE Step 1.5로 2분짜리 음악을 만들고, 캐릭터 시트를 기반으로 일관성 있는 2분짜리 뮤직비디오를 만드는 문제는 저도 개인적으로 관심이 많아서 정말 여러 가지 방법을 많이 테스트해봤습니다.

아래 영상은 제가 처음으로 이런 방식을 본격적으로 시도했던 영상입니다.

https://www.youtube.com/watch?v=Y5bWVVYntAs

당시 제가 원했던 것은 여러 장면을 단순히 이어 붙이는 방식이 아니라, 마치 가상의 가수가 하나의 긴 흐름 안에서 음악 전체를 이어서 부르는 것처럼 보이게 만드는 것이었습니다.

그래서 정말 여러 가지 방법을 시도했습니다. 예를 들어 한 영상의 마지막 프레임을 추출하고, 그 프레임을 다음 영상의 첫 번째 이미지로 다시 사용해서 영상을 계속 이어가는 방식도 테스트했습니다.

이 방법은 장면과 장면 사이의 연결 자체는 자연스럽게 만들 수 있습니다. 하지만 2분 정도 길이로 계속 반복하다 보면 문제가 생깁니다. 영상 생성 과정에서 조금씩 발생한 얼굴 변화, 디테일 손실, 배경 변화, 색감 변화 등이 다음 영상의 입력 이미지로 다시 전달되고, 그 이미지가 또 다음 영상의 입력으로 사용되면서 오차가 누적됩니다. 결국 시간이 길어질수록 처음의 인물과 마지막의 인물이 조금씩 달라지거나, 전체적인 화질이 열화되는 현상이 생각보다 크게 발생했습니다.

그래서 여러 방법을 테스트해본 뒤 제가 내린 결론은, 현재 AI 영상 모델의 특성상 2분 전체를 하나의 연속된 생성 과정처럼 완벽하게 유지하는 것은 생각보다 쉽지 않다는 것입니다.

여기서 중요한 것은 단순히 모델 성능의 문제가 아니라, 사람의 연출 방식과 AI의 생성 방식 자체가 다르다는 점이라고 생각합니다.

예를 들어 사람이 영상을 연출할 때는 “남자가 힘겹게 걷는다”라는 장면 하나만 두고도 여러 가지 선택을 합니다. 먼지나 흙이 묻은 구두를 클로즈업해서 걸음만 보여줄 수도 있고, 축 늘어진 어깨를 중심으로 잡은 뒤 카메라를 천천히 줌아웃할 수도 있고, 혹은 멀리서 전신을 잡아 외롭고 쓸쓸한 분위기를 강조할 수도 있습니다.

즉, 인간은 “이 장면에서 어떤 감정을 어떤 방식으로 보여줄 것인가”를 고민하면서, 무엇을 강조하고 무엇을 덜 보여줄지 선택합니다. 어떤 화면은 강하게, 어떤 화면은 약하게, 어떤 화면은 타이트하게, 어떤 화면은 여유롭게 담아내면서 관객의 호흡과 감정선을 의도적으로 조절합니다.

그런데 현재의 AI는 이런 식의 연출적 우선순위를 스스로 잡는 데 한계가 있습니다. 직접적으로 지시하지 않으면 장면 안에 들어 있는 여러 요소를 거의 모두 중요하다고 판단하는 경향이 있고, 그래서 “남자가 걷는 장면”이라고 하면 사람이 의도했을 법한 감정 포인트 하나를 선택해서 밀어주기보다는, 남자와 배경과 동작을 전부 한 화면 안에 최대한 담아내는 쪽으로 결과가 나오는 경우가 많습니다.

문제는 영상이란 결국 연속성이 있는 장면들의 나열인데, 모든 장면이 다 중요해 보이게 만들어지면 오히려 무엇을 말하고 싶은 영상인지가 잘 보이지 않게 됩니다. 한 장면 한 장면만 놓고 보면 그럴듯해 보여도, 그것들이 이어졌을 때 감정의 강약이나 호흡의 조절이 없으면 보는 사람 입장에서는 메시지나 감정선이 흐릿해질 수 있습니다.

그래서 AI로 긴 뮤직비디오를 만들 때는 단순히 “일관성 있는 캐릭터를 만드는 것”만 중요한 것이 아니라, “각 장면에서 무엇을 보여주고 무엇을 덜 보여줄 것인지”를 사람이 먼저 설계해주는 것이 굉장히 중요하다고 생각합니다.

예를 들어 저처럼 가상의 가수 한 명이 계속 등장하면서 노래를 부르는 형태를 만들고 싶다면, 매 영상 클립마다 이전 영상의 마지막 프레임을 계속 재사용하는 방식보다는 캐릭터 시트를 기준으로 새로운 시작 이미지를 계속 생성하는 방식이 현재로서는 더 안정적이라고 생각합니다.

예를 들면 다음과 같은 흐름입니다.

캐릭터 시트

→ 장면 1 시작 이미지 생성

→ 영상 생성

→ 다시 캐릭터 시트를 참조해 장면 2 시작 이미지 생성

→ 영상 생성

→ 다시 캐릭터 시트를 참조해 장면 3 시작 이미지 생성

→ 영상 생성

이런 방식입니다.

이렇게 하면 이전 영상의 마지막 프레임을 계속 재활용하면서 생기는 화질 열화나 왜곡 누적을 줄일 수 있습니다. 다만 이 방식에서도 결국 가장 큰 문제는 새롭게 생성되는 이미지마다 동일한 캐릭터를 얼마나 정확하게 유지할 수 있느냐입니다. 그래서 캐릭터 시트뿐 아니라 Reference Image, LoRA, 동일한 의상과 헤어스타일, 얼굴 방향, 카메라 거리 같은 조건을 최대한 고정해서 사용하는 것이 중요합니다.

반대로 굳이 원테이크 형태가 아니라 일반적인 뮤직비디오처럼 접근한다면 훨씬 자유롭게 만들 수 있습니다. 예를 들어 2분짜리 음악을 5초~10초 정도의 여러 구간으로 나눈 뒤, 각 구간마다 서로 다른 연출을 사용하는 방식입니다.

예를 들면

실내

→ 길을 걷는 장면

→ 자동차 안

→ 바닷가

→ 공연 장면

→ 회상 장면

처럼 구성할 수도 있습니다.

이런 방식에서는 모든 장면을 물리적으로 완벽하게 연결하는 것보다 캐릭터, 의상, 색감, 촬영 스타일, 분위기를 일정하게 유지하는 것이 훨씬 중요합니다. 개인적으로는 현재 AI 영상 모델들의 특성을 고려하면 이 방식이 훨씬 현실적이라고 생각합니다.

다만 여기서 또 다른 문제가 생깁니다. 결국 2분 동안 어떤 이야기를 보여줄 것인가를 사람이 먼저 결정해야 하기 때문입니다.

현재 AI가 상당히 많은 것을 잘하지만, 제가 생각하기에 여전히 어려운 영역 중 하나가 사람이 실제로 느끼는 감정선을 길게 설계하는 부분입니다. “슬픈 뮤직비디오를 만들어줘”, “행복한 이야기를 만들어줘”, “감동적인 스토리를 만들어줘”라고 하면 장면 자체는 꽤 잘 만들어냅니다. 하지만 2분 동안 시청자가 실제로 감정을 따라갈 수 있도록 장면의 순서, 강조 포인트, 변화, 클라이맥스를 설계하는 것은 아직 사람의 개입이 상당히 필요하다고 생각합니다.

그래서 제가 지금 2분짜리 AI 뮤직비디오를 만든다면 대략 다음과 같은 방식으로 접근할 것 같습니다.

ACE Step 1.5로 음악 생성

→ 가사와 음악 구조 분석

→ Intro / Verse / Chorus / Bridge 등으로 구간 분리

→ 각 구간에서 어떤 감정과 장면을 보여줄지 사람이 먼저 결정

→ 캐릭터 시트 제작

→ Qwen Edit, GPT-Image-2 등의 이미지 모델로 장면별 시작 이미지 생성

→ LTX 2.5 같은 영상 모델로 각 장면을 짧은 클립으로 생성

→ 음악 타이밍에 맞춰 클립 편집

→ 필요한 부분만 프레임 연결이나 전환 효과 사용

즉, 2분짜리 영상을 하나의 긴 AI 영상으로 생성한다기보다, 2분짜리 뮤직비디오를 여러 개의 짧은 장면으로 먼저 설계하고, 캐릭터와 영상 스타일의 일관성을 관리하면서 각각 생성한 뒤 최종적으로 편집한다고 생각하는 편이 현재로서는 더 현실적인 접근이라고 생각합니다.

특히 후렴구처럼 반복되는 구간에서는 같은 장소, 같은 의상, 같은 카메라 구도 같은 요소를 의도적으로 다시 등장시키는 것도 좋습니다. 모든 장면이 완벽하게 물리적으로 연결되지 않더라도 시청자는 반복되는 인물, 의상, 공간, 색감, 촬영 스타일을 통해 하나의 뮤직비디오라고 인식하기 때문입니다.

뮤직비디오는 정해진 제작 원칙이 거의 없는 장르이기 때문에 사람의 아이디어를 다양하게 적용할 수 있고, 그런 면에서는 AI 영상과 굉장히 잘 맞는 분야라고 생각합니다. 반대로 질문하신 것처럼 캐릭터나 분위기의 일관성이 무너지면 각각의 영상 품질이 아무리 좋아도 결국 서로 관계없는 영상들을 이어 붙인 것처럼 보일 수 있습니다.

그래서 긴 AI 영상을 만들 때는 단순히 어떤 영상 모델을 사용할 것인가보다 먼저, 어떤 방식으로 장면을 나눌 것인지, 어떤 감정을 어떤 화면으로 보여줄 것인지, 그리고 무엇을 끝까지 동일하게 유지할 것인지를 사람이 먼저 설계하는 것이 더 중요하다고 생각합니다.

섹션 2 - 9강. API 관련 질문

0

13

1

deskrpg 최신 버전에서 게이트웨이 연결이 안됩니다.

0

16

2

아웃룩을 사용하지 않고, 개인메일이나 회사메일로 발송하는 방법 문의

0

9

0

강의 자료에 대한 질문입니다.

0

21

1

환경 셋팅관련 동영상이 어디에 업로드되어 있나요?

1

27

1

카카오톡 sdk 로그인

0

16

0

강의 자료 요청드립니다.

0

18

1

describe()

0

21

1

서브에이전트

0

17

0

헤더에서 empty column이 삭제가 안되고, 헤더 레이아웃을 동영상처럼 선택하는 옵션이 안나오는데 어떻게 하나요?

0

15

1

수강기간 연장 문의

0

36

2

강의 목차와 영상 내용 불일치

1

35

2

클로드 코워크와 챗의 통합

0

29

1

6분46초

0

27

2

참고 자료 요청

0

22

1

2강 - 눈에 보이는 낭비, 눈에 보이지 않는 낭비: 값의 의미

1

31

1

공략법

0

33

1

스크립트 한국어로 나오다가 영어로 나옴

1

25

1

빅데이터분석기사 실기 인코딩

0

40

2

docker deskop은 항상 켜놓아야하나요?

0

38

1

Owal Alpha무료모델 없음

0

39

2

"run_nvidia_gpu.bat" 실행후

0

58

1

잘못된 파일 다운로드

0

63

1

수업자료는 어디서 받나요

0

68

2