
오픈 웨이트 AI 비디오 모델은 빠르게 발전하고 있다. 과거에는 직접 다운로드할 수 있는 모델이 상용 서비스보다 화질과 움직임에서 크게 뒤처지는 경우가 많았다. 지금은 상황이 달라졌다. 일부 공개 가중치 모델이 폐쇄형 상용 모델과 같은 평가표에서 경쟁하고 있으며, 특정 작업에서는 더 높은 선호도를 기록하기도 한다.
그 중심에 MiniMax H3가 있다. 2026년 8월 7일 기준 Artificial Analysis의 오디오 포함 Text-to-Video 평가에서 MiniMax H3는 전체 2위에 올라 있으며, 오픈 웨이트 모델 중에서는 가장 높은 순위를 기록하고 있다. 비디오 편집 부문에서는 전체 모델 가운데 1위로 표시된다.
따라서 "MiniMax H3는 오픈 웨이트 모델 중 몇 위인가?"라는 질문에 대한 현재 답은 비교적 명확하다. 텍스트 기반 영상 생성에서는 오픈 웨이트 1위이자 전체 2위이며, 비디오 편집에서는 전체 1위다.
다만 순위만으로 모든 사용자의 최적 모델을 결정할 수는 없다. 품질, 편집 범위, 로컬 실행 비용, 처리 속도, 라이선스와 사용 목적을 함께 살펴봐야 한다.
모델을 비교하기 전에 두 용어를 구분할 필요가 있다.
오픈 웨이트는 학습된 모델 가중치를 다운로드해 직접 실행하거나 별도의 워크플로에 통합할 수 있다는 의미다. 그러나 학습 데이터, 전체 학습 코드, 라이선스 조건까지 모두 자유롭게 공개되었다는 뜻은 아니다.
오픈 소스라는 표현은 더 넓은 개방성을 암시한다. 실제로는 모델마다 공개 범위와 라이선스가 다르기 때문에 상업적 프로젝트를 시작하기 전에 허용되는 사용 범위를 확인해야 한다.
MiniMax H3를 비롯한 여러 비디오 모델은 일반적으로 "오픈 웨이트"라는 표현으로 분류하는 편이 정확하다. 사용자는 모델을 직접 호스팅하고 워크플로를 수정할 수 있지만, 그것이 모든 용도의 무제한 사용을 자동으로 보장하지는 않는다.

이 표는 절대적인 우열보다는 각 모델의 방향을 보여 준다. MiniMax H3는 현재 공개 평가에서 품질과 편집 능력으로 앞서고 있으며, LTX 계열은 효율성과 오디오-비디오 통합에 집중한다. Wan은 여러 작업별 모델과 공개된 실행 코드가 강점이다.
MiniMax H3의 순위에서 주목해야 할 부분은 단순 생성과 편집 모두에서 높은 평가를 받고 있다는 점이다.
많은 모델은 새로운 장면을 만드는 데 강하지만, 기존 영상을 수정할 때 불필요한 변화가 발생할 수 있다. 제품 하나를 교체했는데 인물의 얼굴이나 배경까지 바뀌거나, 의상 색상을 변경한 뒤 원래 움직임이 달라지는 식이다.
비디오 편집에서는 변화의 크기보다 범위를 지키는 능력이 중요하다. 요청한 부분은 바꾸되 나머지 장면의 구도, 움직임, 조명과 인물의 연기를 보존해야 한다.
MiniMax H3는 이미지, 기존 영상, 음성과 텍스트 지시를 같은 맥락 안에서 활용할 수 있다. 새로운 제품 사진은 교체 대상의 외형을 정의하고, 원본 영상은 움직임과 카메라 방향을 제공한다. 사용자의 지시는 어떤 요소를 바꾸고 무엇을 남겨야 하는지 설명한다.
이러한 구조는 광고, 제품 영상, 패션 콘텐츠처럼 정확한 수정이 필요한 작업에서 유리하다. 영상 전체를 새로 생성하지 않고 특정 요소를 중심으로 다음 버전을 만들 수 있기 때문이다.
Artificial Analysis의 오디오 포함 Text-to-Video 평가에서 MiniMax H3는 전체 2위로 나타난다. 1위와의 점수 범위도 일부 겹치기 때문에 단순 숫자 차이만으로 절대적인 품질 차이를 판단하기는 어렵다.
중요한 점은 오픈 웨이트 모델이 상용 폐쇄형 모델과 같은 최상위 구간에서 경쟁하고 있다는 사실이다.
기존에는 로컬 실행과 커스터마이징을 원하면 영상 품질을 어느 정도 포기해야 하는 경우가 많았다. 반대로 높은 품질을 원하면 특정 서비스와 API에 의존해야 했다.
MiniMax H3는 이 간격을 줄이는 모델이다. 개발자는 공개된 가중치를 기반으로 자체 환경을 구성할 수 있고, 제작 팀은 호스팅 서비스를 통해 보다 간편하게 접근할 수도 있다.
즉, 오픈 웨이트를 선택하는 이유가 더 이상 비용 절감이나 연구 목적에만 제한되지 않는다. 최상위 영상 품질과 편집 제어 자체가 선택의 근거가 될 수 있다.
LTX-2 계열은 오픈 웨이트 비디오 생태계에서 중요한 위치를 차지한다. 영상과 동기화된 오디오 생성, 비교적 효율적인 실행, 제작 도구와의 통합을 강조한다.
현재 Artificial Analysis의 오디오 포함 Text-to-Video 전체 순위에서는 LTX-2.3 Fast와 Pro가 MiniMax H3보다 낮게 표시된다. 그러나 순위가 낮다고 해서 실용성이 없는 것은 아니다.
LTX의 장점은 작업 효율과 선택 가능한 성능 모드다. 최고 품질만 필요한 것이 아니라 빠른 초안, 로컬 실험, 반복적인 프리비주얼 작업이 중요하다면 LTX가 더 경제적인 선택이 될 수 있다.
MiniMax H3는 최종 품질, 레퍼런스 활용과 편집 제어에 더 높은 우선순위를 두는 프로젝트에 적합하다. LTX는 속도와 인프라 효율을 중시하는 팀에게 매력적일 수 있다.
모델 선택은 최고 점수보다 제작 환경과 더 밀접하게 연결되어 있다.
Wan 2.2는 여러 작업에 맞춘 공개 모델을 제공한다. 텍스트 투 비디오, 이미지 투 비디오, 음성 기반 영상, 캐릭터 애니메이션과 교체를 위한 체크포인트가 구분되어 있다.
특히 5B TI2V 모델은 720p와 24fps를 지원하며, 비교적 현실적인 소비자용 GPU 환경을 고려한 선택지다. 더 큰 모델은 높은 메모리 요구량을 가질 수 있지만, 여러 변형이 존재하기 때문에 사용자는 하드웨어와 작업 목적에 맞춰 선택할 수 있다.
Wan의 장점은 넓은 공개 생태계다. ComfyUI와 Diffusers 통합, 모델 가중치와 실행 코드, 다양한 작업별 구성이 제공된다. 연구하거나 세부 파이프라인을 직접 조정하려는 사용자에게 유용하다.
MiniMax H3는 여러 입력과 편집을 보다 통합된 방식으로 다룬다는 점에서 차이가 있다. Wan에서는 작업에 맞는 체크포인트와 파이프라인을 선택하는 과정이 중요하지만, H3는 하나의 모델 안에서 생성, 레퍼런스와 수정의 연결성을 강화한다.
영상 제작자는 항상 빈 화면에서 시작하지 않는다. 촬영 영상, 이전 캠페인, 제품 사진, 배우의 연기, 승인된 장면처럼 이미 가치가 있는 자료를 가지고 작업한다.
이때 필요한 것은 새로운 영상을 만드는 능력보다 기존 자산을 살리는 능력이다.
MiniMax H3가 현재 비디오 편집 평가에서 전체 1위라는 점은 이러한 제작 현실과 연결된다. 제품을 교체하거나, 인물의 스타일을 수정하고, 배경을 변경하면서 원본 장면의 중요한 부분을 유지할 수 있다면 하나의 영상은 여러 캠페인에 활용될 수 있다.
최고의 장면을 버리지 않고 필요한 부분만 수정할 수 있다는 것은 품질뿐 아니라 비용에도 영향을 준다. 재촬영과 수작업 합성을 줄이고, 승인된 소재를 여러 버전으로 확장할 가능성이 생기기 때문이다.
대량 제작 환경에 MiniMax H3를 연결하려는 팀은 MiniMax H3 API를 활용한 자동화 흐름도 검토할 수 있다. 다만 모든 출력은 제품 정확성, 인물 일관성, 라이선스와 브랜드 기준에 따라 사람이 다시 확인해야 한다.
가중치를 내려받을 수 있다고 해서 로컬 실행 비용이 0원이 되는 것은 아니다.
고성능 비디오 모델에는 충분한 GPU 메모리, 저장 공간, 추론 시간과 전력이 필요하다. 최적화된 체크포인트와 양자화를 사용하면 요구 사항을 낮출 수 있지만, 설정과 유지 관리에는 기술 인력이 필요할 수 있다.
반대로 API나 호스팅 서비스는 인프라를 직접 관리하지 않아도 되지만, 생성량이 증가하면 사용 비용도 함께 늘어난다.
따라서 다음 조건을 비교해야 한다.
매월 생성할 영상의 수
필요한 해상도와 길이
초안과 실패 결과를 포함한 반복 횟수
로컬 GPU의 구매 또는 임대 비용
설치와 유지 관리에 필요한 기술 시간
데이터가 외부 서버로 전송되어도 되는지 여부
소규모 테스트에는 호스팅 방식이 간편할 수 있다. 지속적인 대량 생성이나 사내 데이터 통제가 중요하다면 로컬 또는 혼합형 구성이 더 적합할 수 있다.
호스팅 기반 제작 비용을 계획하는 팀은 Minimax h3 pricing을 확인하고, 최종 결과물만이 아니라 테스트와 수정 횟수까지 포함해 예산을 계산하는 편이 좋다.
현재 공개 평가만 기준으로 보면 MiniMax H3는 가장 강력한 오픈 웨이트 비디오 모델로 평가할 근거가 충분하다. Text-to-Video에서는 오픈 웨이트 모델 중 가장 높은 순위이며, 비디오 편집에서는 폐쇄형 모델을 포함한 전체 1위다.
하지만 실제 선택은 작업 유형에 따라 달라진다.
최고 수준의 품질과 정밀한 편집, 여러 레퍼런스의 통합이 중요하다면 MiniMax H3가 가장 먼저 테스트할 모델이다.
빠른 로컬 생성과 낮은 실행 비용이 우선이라면 LTX 계열도 검토할 가치가 있다. 세분화된 모델, 캐릭터 애니메이션과 연구 친화적인 생태계가 필요하다면 Wan 계열이 유용할 수 있다.
가장 좋은 방법은 동일한 프롬프트와 레퍼런스를 사용해 직접 비교하는 것이다. 생성 품질뿐 아니라 시간적 일관성, 지시 준수, 수정하지 않은 부분의 안정성과 필요한 하드웨어를 함께 측정해야 한다.
순위는 계속 바뀔 수 있다. 그러나 2026년 8월 현재 MiniMax H3가 보여 주는 위치는 분명하다. 오픈 웨이트 모델이 상용 모델을 따라가는 단계가 아니라, 영상 생성과 편집의 기준을 직접 끌어올리는 단계에 도달했다는 것이다.