inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

미니맥스 H3 사용 방법: 초보자를 위한 완벽 FAQ 가이드

279

Sinpor Wang

작성한 질문수 3

0

미니맥스 H3 사용 방법: 초보자를 위한 완벽 FAQ 가이드

2026년 7월 31일, MiniMax가 차세대 AI 영상 생성 모델 미니맥스 H3(Hailuo 3.0)을 정식 출시했습니다. 네이티브 2K, 15초 클립, 단일 패스 스테레오 오디오, 오픈 웨이트 공개까지 — 이 모델을 어떻게 실전에서 활용하는지, 자주 묻는 질문 중심으로 정리합니다. 자세한 내용은 미니맥스 H3에서 확인하실 수 있습니다.


기본 개념

Q1. 미니맥스 H3이 뭔가요?

텍스트, 이미지, 비디오, 오디오를 하나의 컨텍스트로 읽고 2K 영상 + 스테레오 오디오를 동시에 출력하는 범용 멀티모달 비디오 모델입니다. 생성, 편집, 레퍼런스 제어를 별개의 모델이 아닌 하나의 모델 안에서 처리합니다. 기술적으로는 Hailuo 3.0, Hailuo H3, Hailuo 03 모두 같은 모델을 가리킵니다.

Q2. 어디서 사용할 수 있나요?

MiniMax의 소비자 플랫폼인 Hailuo AI에서 직접 사용 가능합니다. API를 통한 개발자 접근도 가능하며, fal.ai, OpenArt, Apiframe, OrcaRouter, PixMind 등 파트너 플랫폼에서도 이용할 수 있습니다. fal.ai에서는 text-to-video, first-and-last-frame, reference-to-video 세 가지 엔드포인트로 나뉘어 제공됩니다.

Q3. 출력 사양은?

네이티브 2K(2560×1440) 해상도, 24fps, 5~15초 클립을 생성합니다. 연장 기능으로 약 30초까지 확장 가능합니다. 화면 비율은 21:9, 16:9, 4:3, 1:1, 3:4, 9:16의 6가지를 지원하며, adaptive(자동) 옵션도 있습니다. 768p 모드도 제공 예정이며, 768p → 1440p 업스케일이 가능합니다.


3가지 생성 모드

Q4. 어떤 모드를 골라야 하나요?

미니맥스 H3은 입력에 따라 세 가지 모드로 나뉩니다. 구분법은 간단합니다.

Text to Video: 미디어 파일 없이 텍스트만 입력하는 경우입니다. 텍스트 프롬프트만으로 영상을 생성합니다.

First & Last Frame: 이미지를 첫 프레임 또는 마지막 프레임으로 지정하는 경우입니다. 시작점과 끝점을 이미지로 고정하고, 그 사이를 모델이 채웁니다.

Reference to Video: 이미지, 비디오, 오디오를 "프레임"이 아닌 "참조 자료"로 사용하는 경우입니다. 캐릭터 얼굴 고정, 동작 전이, 스타일 매칭, 음성 복제, 기존 클립 편집 등 가장 강력한 모드입니다.

핵심 구분: 이미지가 "이 장면의 첫 컷이다"면 First & Last Frame, "이 이미지의 얼굴/스타일/배경을 참고해라"면 Reference to Video입니다.


레퍼런스 시스템

Q5. 레퍼런스는 어떻게 쓰나요?

한 번의 생성에 이미지 최대 9장, 비디오 클립 최대 3개(각 2~15초), 오디오 클립 최대 3개를 투입할 수 있으며, 총 파일 수는 12개로 제한됩니다. 중요한 규칙이 하나 있습니다. 오디오는 단독 투입이 불가하며, 반드시 이미지나 비디오와 함께 넣어야 합니다.

핵심 원칙은 각 레퍼런스에 명시적으로 역할을 지정하는 것입니다. 프롬프트에서 "이 이미지는 캐릭터 얼굴용", "이 비디오는 카메라 움직임 참조용", "이 오디오는 배경 음악용"이라고 명확히 써야 모델이 혼동하지 않습니다.

Q6. 실전 레퍼런스 활용 예시는?

캐릭터 일관성 유지: 캐릭터 사진을 아이덴티티 레퍼런스로 넣고, 프롬프트에서 머리 스타일, 의상, 표정 등 유지할 특성을 텍스트로도 함께 기술합니다. 이미지만 믿지 말고 프롬프트에서도 강조하는 것이 팁입니다.

동작 전이: 비디오 레퍼런스의 동작을 다른 캐릭터에 적용합니다. "비디오 1의 댄스 동작을 이미지 1의 캐릭터에 적용. 동작 완전 일치. 카메라 앵글 유지."

음성 복제: 오디오 레퍼런스의 음성 특성을 유지한 대사를 생성합니다. 반드시 이미지나 비디오와 함께 투입해야 합니다.

기존 클립 편집: 수정할 영상을 레퍼런스로 넣고, 프롬프트에서 변경할 부분만 지시합니다. 조명, 프레이밍, 연기 등 승인된 부분은 그대로 유지됩니다.


프롬프트 작성법

Q7. 좋은 프롬프트의 공식은?

미니맥스 H3의 프롬프트는 7요소 구조가 효과적입니다.

주체(Subject) + 동작(Action) + 환경(Environment) + 카메라(Camera) + 조명(Lighting) + 스타일(Style) + 사운드(Sound)

예시: "짧은 검은 머리의 30대 여성이 비 오는 도쿄 뒷골목을 빠르게 걸어간다. 로우 앵글 스테디캠 트래킹 숏. 네온 반사광이 젖은 도로를 비춘다. 시네마틱 필름 그레인. 발걸음 소리와 빗소리가 들린다. 골목 끝에서 멈추며 뒤를 돌아보는 것으로 끝."

핵심 원칙: 스타일 키워드를 나열하기 전에 먼저 "무엇이 움직이고, 카메라가 어떻게 관찰하고, 무슨 소리가 나고, 어디서 끝나는지"를 명확히 하세요. 장면 자체가 불명확하면 스타일 키워드는 효과가 없습니다.

Q8. 오디오도 프롬프트로 제어하나요?

네. 미니맥스 H3은 비디오와 동일한 패스에서 대사, 효과음, 환경 음향을 동시에 생성합니다. 오디오를 별도 트랙처럼 디렉팅하세요. 원하는 악기, 사운드 큐의 타이밍, 침묵이 필요한 구간을 명시합니다. "피아노 인트로 3초, 드럼 비트 시작과 함께 캐릭터 등장, 마지막 2초는 리버브만 남기고 페이드아웃."

Q9. 이미지-투-비디오 프롬프트는 뭐가 다른가요?

업로드된 이미지가 이미 외형과 구도를 전달하고 있으므로, 프롬프트는 동작, 카메라 움직임, 보존 규칙, 환경 변화, 엔딩에 집중해야 합니다. 이미지에 보이는 것을 다시 설명하지 마세요. 대신 "무엇이 변하는가"를 쓰세요.

얼굴, 제품, 라벨, 로고 등 유지해야 할 요소가 있다면 프롬프트 첫 줄에 보존 지시를 넣으세요. "병의 정확한 형태, 라벨 위치, 뚜껑, 재질, 색상, 비율을 유지. 카메라가 천천히 시계 방향으로 공전."


인스트럭션 기반 편집

Q10. 생성된 영상을 수정할 수 있나요?

네. 미니맥스 H3의 인스트럭션 기반 편집은 재생성보다 빠르고 효율적입니다. 수정할 영상을 레퍼런스로 넣고, 바꾸고 싶은 부분만 자연어로 지시합니다. "배경을 해변으로 변경", "캐릭터 옷을 파란색으로", "마지막 2초의 카메라를 줌인으로."

승인된 부분(조명, 프레이밍, 연기)은 그대로 유지되므로, 상업 프로젝트에서 클라이언트 피드백 반영에 특히 유용합니다.

편집 가능 영역: 캐릭터, 오브젝트, 장면, 사운드, 페이싱. Artificial Analysis 벤치마크에 따르면, 미니맥스 H3은 현재 비디오 편집 분야에서 세계 최고 수준으로 평가됩니다.


가격 및 요금

Q11. 가격은 얼마인가요?

MiniMax는 2K 기준 주류 모델의 1/3 미만 비용이라고 발표했습니다. 얼리 액세스 커뮤니티 보고에 따르면, 15초 2K 클립 1개당 약 $1 수준으로 추정됩니다. 일부 파트너 플랫폼에서는 $0.13/초 정도로 보고되고 있습니다. 정확한 글로벌 가격은 정식 API 출시와 함께 확정 예정입니다.

768p 모드를 사용하면 비용이 더 낮아지며, 초안 단계에서는 768p로 테스트 후 최종본만 2K로 생성하는 것이 효율적입니다.


실전 팁

Q12. 결과물 품질을 높이려면?

레퍼런스에 역할을 명확히 지정하세요. "이 이미지는 얼굴 아이덴티티용"처럼 구체적으로 써야 합니다. 이미지 하나에 여러 역할을 맡기면 모델이 혼동합니다.

생성이 거의 맞았다면 전체를 재생성하지 말고, 인스트럭션 기반 편집으로 카메라, 동작, 사운드, 타이밍, 엔딩 중 한 가지만 수정하세요. 한 번에 한 요소만 바꿔야 결과를 평가하기 쉽습니다.

사운드를 별도 트랙으로 디렉팅하세요. 악기 종류, 큐 타이밍, 침묵 구간을 명시하면 오디오 품질이 크게 올라갑니다.

Q13. 캐릭터가 장면마다 달라지는 문제는?

같은 아이덴티티 레퍼런스를 모든 생성에 동일하게 투입하세요. 그리고 프롬프트에서도 유지할 특성(머리 스타일, 의상, 표정)을 텍스트로 반복 기술해야 합니다. 이미지만 넣고 프롬프트에 언급하지 않으면 드리프트가 발생할 수 있습니다.

Q14. First & Last Frame 모드는 언제 쓰나요?

시작 장면과 끝 장면이 명확할 때 씁니다. 두 이미지 사이의 전환을 프롬프트에서 기술하세요. 각 이미지를 따로 설명하는 것보다 "무엇이 움직이고 무엇이 점진적으로 바뀌는가"를 쓰는 게 효과적입니다.


오픈 웨이트 & 기타

Q15. 오픈 웨이트가 뭔가요?

모델 파일을 다운로드하여 자체 서버에서 실행할 수 있다는 뜻입니다. MiniMax는 "며칠 내에" 관련 법률에 따라 H3의 웨이트를 공개할 계획이라고 밝혔습니다. 현재 대부분의 주요 비디오 모델(Veo, Seedance, Kling)은 비공개이므로, 이 결정은 생태계에 큰 영향을 줄 수 있습니다. 정확한 공개 일정과 라이선스 조건은 미정입니다.

Q16. 시작하는 가장 빠른 방법은?

Hailuo AI 플랫폼에 가입한 뒤, 이미지 1~2장 + 간단한 텍스트 프롬프트로 시작하세요. 처음부터 12개 레퍼런스를 다 쓸 필요 없습니다. 텍스트만으로 먼저 감을 잡고, 점차 이미지 → 비디오 → 오디오 레퍼런스를 추가하며 확장하는 것을 권장합니다

답변 1

0

인프런 AI 인턴

안녕하세요, 인프런 AI 인턴입니다.

Sinpor Wang님께서 미니맥스 H3를 잘 활용하기 위한 FAQ를 준비해주셨군요. 비록 미니맥스 H3에 대한 자세한 정보는 현재 제공된 문서에서 다루어지지 않았지만 프로그램 관련하여 다른 도움이 필요하시면 말씀해 주세요. 예를 들어, Spring Boot와 관련된 질문이라면 문서를 통해 도움을 드릴 수 있습니다.

Spring Boot에 대한 자세한 내용은 여기에서 확인하실 수 있습니다:
Spring Boot Reference Documentation

추가질문이 있다면 언제든지 도와드리겠습니다!

17강 강의에 목데이터 첨부파일이 없습니다.

2

43

2

domain에 @Entity 와 Repository를 함께 둔 이유가 궁금합니다

1

62

1

git bash .env

1

37

1

롱폼 영상 강의도 있으신가요? 도움이 많이 되었습니다.

1

25

1