🎬 미니맥스 H3 출시 — 옴니모달 영상 생성의 새로운 기준

미니맥스 H3

텍스트·이미지·영상·오디오를 함께 이해하는 옴니모달 생성 모델입니다. 참조 이미지 최대 9장, 영상 3개, 오디오 3개(합계 최대 12개 파일)를 조합해 네이티브 스테레오 사운드가 포함된 4~15초 영상을 최대 2K로 생성합니다.

🌀 텍스트·이미지·영상·오디오를 하나로

미니맥스 H3 AI 영상 생성기란 무엇인가요?

미니맥스 H3(하이루오 3.0)는 텍스트·이미지·영상·오디오를 함께 이해하는 옴니모달 생성 모델입니다. 참조 이미지 최대 9장, 영상 3개, 오디오 3개를 조합해 네이티브 스테레오 사운드가 포함된 4~15초 영상을 최대 2K로 제작하세요. 강력한 @ 참조 시스템으로 각 자산의 사용 방식을 정확하게 지정할 수 있습니다. 하이루오 시리즈의 3세대 모델로 2026년 7월 31일 공개되었으며, hailuoai.video와 MiniMax 오픈 플랫폼 API에서 바로 이용할 수 있습니다.

옴니모달 입력 지원

참조 이미지 최대 9장, 참조 영상 최대 3개(각 2~15초, 합계 15초 이하), 참조 오디오 최대 3개를 업로드하세요. 혼합 입력은 합계 최대 12개 파일까지 조합할 수 있어 창작 가능성이 넓어집니다. 미니맥스 H3에서는 파일당 영상 50MB, 이미지 30MB, 오디오 15MB까지 올릴 수 있고, 요청 하나의 전체 용량은 64MB까지 허용됩니다.

강력한 @ 참조 시스템

자연어 @ 멘션만으로 각 자산의 사용 방식을 지정하세요. 캐릭터 스타일에는 @Image1, 카메라 움직임에는 @Video1, 사운드트랙에는 @Audio1을 참조하는 등 완벽한 창작 제어가 가능합니다. 프롬프트는 최대 7,000자까지 쓸 수 있으며, 이미지는 JPG·PNG·WEBP·HEIC·HEIF, 영상은 H.264·H.265 형식을 그대로 넣으면 됩니다.

핵심 강점

MiniMax 자체 기준으로 미니맥스 H3가 내세우는 대표적인 강점은 정밀한 지시 이해, 화면 속 텍스트와 브랜드 정보 표현, 영상 참조 기반 동작 전이입니다. MiniMax 발표에 따르면 사전 학습 단계부터 멀티샷 구성을 명시적으로 모델링했습니다. MiniMax 자체 기준으로 2K 초당 단가는 주요 모델의 3분의 1 이하 수준입니다.

미니맥스 H3 활용 예시

옴니모달 AI 영상 생성이 실제로 어떻게 쓰이는지 데모로 확인해 보세요. 어떤 입력이 어떤 결과로 이어졌는지 사례마다 나란히 정리했습니다. MiniMax가 제시한 주요 활용 분야는 광고, 브랜드 캠페인, 이커머스, 제품 디자인, UI·UX, 게임이며, 이 작업들을 미니맥스 H3 하나로 이어서 진행할 수 있습니다.

창의적인 템플릿 & 복합 효과

어안 렌즈 효과, 플래시 오버레이, 의상 변경을 정밀하게 복제합니다. 다이내믹한 카메라 컷 속에서도 같은 모델의 얼굴을 여러 의상에 그대로 유지합니다. 참조 이미지를 한 번에 최대 9장까지 넣을 수 있어 룩북 한 세트를 그대로 한 편의 영상으로 묶을 수 있습니다.

모델 참조 및 의상

첫 번째 이미지의 모델 얼굴 특징을 참조합니다. 모델은 참조 이미지 2~6의 의상을 입고 장난스럽고, 쿨하고, 귀엽고, 놀랍고, 스타일리시한 포즈로 카메라에 다가옵니다. 각 의상 변경은 참조 영상의 어안 렌즈 효과와 플래시 오버레이를 사용하여 카메라 컷을 유발합니다.

동작 및 카메라 복제

한 영상의 캐릭터 동작과 다른 영상의 카메라 움직임을 결합합니다. 별이 빛나는 밤하늘 아래 먼지 효과와 영화 같은 긴장감이 감도는 웅장한 전투 장면을 만듭니다. 참조 영상 두 개를 동시에 읽어 동작과 카메라를 따로 가져오는 영상 참조 기반 동작 전이는 MiniMax 발표 기준 미니맥스 H3의 강점입니다.

캐릭터 참조

영상 1의 캐릭터 동작과 영상 2의 궤도 카메라 움직임을 참조합니다. 별이 빛나는 밤하늘 아래 캐릭터 1과 캐릭터 2의 전투 장면을 생성하며, 전투 중 흰 먼지가 피어오릅니다. 전투는 장관이며 강렬한 분위기를 자아냅니다.

영상 확장

일관성을 유지하면서 영상을 자연스럽게 확장합니다. 오토바이를 타는 당나귀가 다양한 영화적 숏을 통과하는 기발한 광고 시나리오를 만듭니다. 미니맥스 H3에서는 각 2~15초, 합계 15초 이하의 참조 영상을 최대 3개까지 올려 그 뒤를 이어 붙일 수 있습니다.

오토바이 타는 당나귀 참조

오토바이를 탄 당나귀의 @image1과 @image2를 참조하여 15초 영상을 확장합니다. 장면 1: 당나귀가 울타리를 뚫고 나와 닭들을 놀래키는 측면 숏. 장면 2: 모래 위에서 오토바이 묘기를 부리는 당나귀, 타이어 클로즈업 후 항공 숏. 장면 3: 산을 배경으로 당나귀가 점프하며 마스킹 효과를 통해 'Inspire Creativity, Enrich Life' 텍스트가 드러남.

시네마틱 오디오 & 비주얼

정밀한 촬영 키워드로 MV 품질의 콘텐츠를 생성합니다. 골든 아워 조명과 필름 그레인 미학을 갖춘 영화 같은 구도를 만듭니다. 프롬프트가 최대 7,000자까지 허용되므로 조명, 렌즈, 화면 구성, 색감을 문장 단위로 나눠 지시할 수 있습니다.

시네마틱 장면 참조

15초 분량의 MV 영상을 생성합니다. 키워드: 안정적인 구도, 부드러운 푸시-풀, 로우 앵글 히어로 숏, 다큐멘터리 느낌의 프리미엄 감성. 초광각 설정 숏, 약간 위로 기울인 로우 앵글, 하단 3분의 1 지점에 빈티지 여행용 자동차가 있는 절벽 흙길, 깊이감을 주는 먼 바다와 수평선, 먼지 입자 사이로 비치는 볼류메트릭 광선이 있는 일몰 측후면광, 시네마틱 프레이밍, 진정한 필름 그레인, 바람에 부드럽게 움직이는 옷.

영상 편집 & 캐릭터 교체

기존 영상의 동작과 움직임을 그대로 둔 채 캐릭터만 교체합니다. 밴드 연주는 이어지고 여성 보컬만 남성 가수로 바뀝니다. 이런 편집 작업에서 미니맥스 H3는 Artificial Analysis Video Editing 부문 Elo 1,130으로 1위에 올랐습니다.

남성 가수 참조

영상 1의 여성 리드 싱어를 이미지 1의 남성 가수로 교체합니다. 동작은 원본 영상과 완전히 일치해야 합니다. 카메라 컷 없음. 밴드는 계속 연주합니다.

원테이크 롱테이크

여러 참조 이미지를 사용하여 끊김 없는 원테이크 시퀀스를 만듭니다. 거리에서 계단, 복도, 옥상으로 이어지는 주자를 단일 연속 숏으로 따라갑니다. 장면마다 다른 이미지를 @로 지목하면 카메라 한 대가 계속 따라가는 듯한 흐름이 완성됩니다.

장면 시퀀스 참조

@image1 @image2 @image3 @image4 @image5, 원테이크 트래킹 숏, 거리에서 계단 위로, 복도를 지나 옥상으로 이동하여 도시 전경으로 끝나는 주자를 따라감.

창의적인 줄거리 완성

최소한의 입력으로 AI가 감성적인 서사를 완성하도록 맡겨 보세요. 영감을 주는 이미지와 오디오만 넣으면 분위기 있는 스토리가 만들어집니다. 참조 오디오를 최대 3개까지 읽어 들여 음악의 흐름에 맞춰 장면을 배치합니다.

스토리 영감 이미지

영상 1의 오디오를 사용하여 이미지 1~5에서 영감을 받은 감성적인 영상을 만듭니다. 배경 음악은 @video1을 참조합니다.

3단계로 만드는 미니맥스 H3 영상

참조 이미지 9장, 영상 3개, 오디오 3개를 조합해 한 편의 AI 영상으로 완성하세요. 자산 업로드부터 완성본 다운로드까지, 미니맥스 H3에서는 세 단계면 끝납니다.

1

자산 업로드

참조 이미지 최대 9장, 영상 최대 3개(각 2~15초, 합계 15초 이하), 오디오 최대 3개를 업로드하세요. 혼합 입력은 합계 최대 12개 파일까지 조합할 수 있습니다. 파일당 상한은 영상 50MB, 이미지 30MB, 오디오 15MB입니다.

2

@ 참조를 사용한 프롬프트 작성

자연어와 @ 멘션을 사용하여 각 자산의 사용 방식을 지정하세요. 예: '@Image1을 캐릭터로 참조, @Video1을 카메라 움직임으로 사용'. 프롬프트는 최대 7,000자까지 입력할 수 있어 장면 순서까지 자세히 적어둘 수 있습니다.

3

4~15초 영상 생성

4초에서 15초 사이의 길이를 선택하세요. 네이티브 스테레오 사운드가 포함된 최대 2K 영상을 받아 공유하거나 추가로 편집하세요. 미니맥스 H3의 공식 API 가격은 2K 기준 초당 $0.13이며, 768P는 초당 $0.09의 비공개 베타로 영업 문의가 필요합니다.

미니맥스 H3의 9가지 핵심 기능

옴니모달 생성 모델로 모든 창의적인 시나리오를 완성하세요. 참조 이미지 9장, 영상 3개, 오디오 3개를 조합하면 미니맥스 H3가 스테레오 사운드까지 한 번에 만들어 냅니다.

완벽한 일관성

여러 숏에 걸쳐 캐릭터 얼굴, 제품 디테일, 화면 속 텍스트와 브랜드 요소를 일관되게 유지합니다. 로고와 카피가 노출되는 광고 컷에서 특히 도움이 됩니다.

동작 복제

참조 영상의 카메라 움직임과 캐릭터 동작을 옮겨오는 영상 참조 기반 동작 전이는 MiniMax가 자체 기준으로 제시하는 강점입니다. 참조 영상은 최대 3개까지 동시에 읽어 동작과 카메라를 따로 가져올 수 있습니다.

창의적인 템플릿

참조 영상의 까다로운 전환 효과와 연출 스타일을 미니맥스 H3가 그대로 재현합니다. 복잡한 컷 전환도 프롬프트 한 줄로 지정할 수 있습니다.

줄거리 완성

최소한의 이미지와 오디오 입력을 기반으로 AI가 스토리의 빈틈을 창의적으로 채웁니다.

영상 확장

이미 만든 영상 뒤에 새 장면을 이어 붙이세요. 미니맥스 H3는 참조 영상을 최대 3개까지 읽어 움직임과 배경을 일관되게 유지합니다.

네이티브 스테레오 오디오

영상과 오디오를 한 번에 생성해 스테레오 사운드가 입혀진 상태로 내보냅니다. 미니맥스 H3의 결과물은 별도 사운드 편집 없이 최대 2K로 바로 쓸 수 있습니다.

롱테이크

여러 이미지·영상 참조를 조합해 끊김 없는 원테이크 숏을 구성합니다. 4~15초 안에서 컷을 나누지 않고 이어지는 구성을 만들 수 있습니다.

영상 편집

캐릭터 교체와 부분 수정에 강한 영역입니다. 2026년 7월 31일 기준 Artificial Analysis 평가에서 미니맥스 H3는 Video Editing 부문 Elo 1,130으로 1위, Text-to-Video 2위(1,242), Image-to-Video 3위(1,184)를 기록했습니다.

오디오 참조

참조 오디오를 최대 3개까지 함께 이해해 원하는 사운드 분위기를 영상에 반영합니다.

미니맥스 H3에 대한 크리에이터들의 후기

미니맥스 H3로 전환한 영화 제작자와 콘텐츠 크리에이터들의 이야기를 들어보세요.

옴니모달 입력은 정말 획기적입니다. 상상도 못 했던 방식으로 이미지, 영상, 오디오를 결합할 수 있습니다.

David Chen, 디지털 아티스트

David Chen

디지털 아티스트

@ 참조 시스템 덕분에 정밀한 제어가 가능합니다. 각 자산을 어떤 역할로 쓸지 문장 하나로 미니맥스 H3에 지시할 수 있습니다.

Rachel Kim, 콘텐츠 크리에이터

Rachel Kim

콘텐츠 크리에이터

동작 전이 기능이 믿을 수 없을 정도로 정확합니다. 참조 영상의 카메라 움직임을 첫 시도에 그대로 살려 냈습니다.

Marcus Thompson, 영화 제작자

Marcus Thompson

영화 제작자

네이티브 스테레오 사운드가 인상적입니다. 별도 편집 없이 바로 게시할 수 있는 수준의 영상이 나옵니다.

Sofia Garcia, YouTube 크리에이터

Sofia Garcia

YouTube 크리에이터

여러 숏에 걸친 캐릭터 일관성이 훌륭합니다. 이제 캠페인 영상 전체를 미니맥스 H3 하나로 만들고 있습니다.

James Wilson, 마케팅 이사

James Wilson

마케팅 이사

참조 오디오를 함께 넣으면 원하던 분위기가 그대로 반영됩니다. 브랜드 톤을 맞추기가 훨씬 쉬워졌습니다.

Anna Zhang, 소셜 미디어 매니저

Anna Zhang

소셜 미디어 매니저

미니맥스 H3 자주 묻는 질문

미니맥스 H3 AI 영상 생성기의 기능에 대해 자세히 알아보세요.







원하는 내용을 찾을 수 없나요? 고객 지원팀에 문의하세요.

미니맥스 H3로 창작 시작하기

텍스트·이미지·영상·오디오를 하나로 결합해 보세요. 네이티브 스테레오 사운드가 포함된 4~15초 영상을 최대 2K로 만들 수 있습니다.