Skip to content

레퍼런스 이미지를 지원하는 최고의 AI 비디오 모델(2026년)

최종 업데이트: 2026년 9월.

이제 10초짜리 클립을 만드는 일은 쉽습니다. 주요 모델이라면 모두 할 수 있습니다. 진짜 질문은 이것입니다. 1분째와 8분째에도 캐릭터의 외모가 동일하게 유지되고, 수백 프레임에 걸쳐 장면의 일관성이 보존되는 5분 또는 10분짜리 비디오를 만들 수 있을까요?

바로 이것이 어려운 문제입니다. 그리고 현재 가장 빠르게 변화하고 있는 분야이기도 합니다. 이 가이드에서는 장편 비디오를 네이티브로 생성하거나, 레퍼런스 이미지를 통해 캐릭터의 일관성을 유지하면서 장편 콘텐츠를 제작하는 데 필요한 워크플로를 지원하는 모든 모델을 다룹니다. 모델은 세 등급으로 나눴습니다. 몇 분 길이의 비디오를 직접 생성하는 모델, 강력한 레퍼런스 이미지 지원과 이어서 생성하는 기능을 갖춘 모델, 그리고 직접 실행할 수 있는 오픈 소스 옵션입니다.

1등급: 네이티브 장편 생성(수분 이상)

이 모델들은 초가 아니라 분 단위 길이의 비디오를 생성합니다. 긴 시퀀스 전반에서 시간적 일관성을 유지하도록 처음부터 설계되었습니다.

LongCat Video

Meituan은 2025년 말 LongCat Video를 공개했습니다. 136억 개의 파라미터를 갖춘 디퓨전 트랜스포머로, 최대 15분 길이의 일관된 비디오를 안정적으로 생성할 수 있는 최초의 모델입니다.

이 모델은 하나의 통합 파이프라인에서 텍스트-투-비디오, 이미지-투-비디오, 비디오 이어서 생성을 지원합니다. I2V 모드에서는 입력 이미지가 비디오의 실제 첫 프레임이 됩니다. 어떤 장면에든 배치할 수 있는 느슨한 캐릭터 레퍼런스는 아닙니다. 모델은 이 시작 프레임부터 앞으로 애니메이션을 생성하며, 생성 과정 내내 원본 이미지를 계속 참조하도록 하는 "Cross-Chunk Latent Stitching"을 사용합니다. 이를 통해 색상 변화를 방지하고 긴 시퀀스에서도 시각적 일관성을 유지합니다. 2026년 업데이트 버전에는 립싱크를 지원하는 오디오 기반 아바타 생성 기능이 추가되어 5분 이상의 토킹 헤드 비디오를 만들 수 있습니다.

내부적으로 LongCat은 Block Sparse Attention을 적용한 거친 단계에서 정밀한 단계로 이어지는 생성 방식을 사용해 방대한 시퀀스 길이를 처리합니다. RLHF 튜닝으로 움직임 품질을 개선했습니다. VBench 2.0 벤치마크에서는 Google Veo 3와 Shengshu의 Vidu Q1에 이어 종합 3위를 기록했습니다.

제공 방식: MIT 라이선스의 오픈 소스입니다. fal.ai API에서 생성된 비디오 1초당 $0.04로 이용할 수 있습니다(720p 15분 비디오 기준 $36). LongCat 자체 플랫폼에서도 크레딧 기반 요금제로 제공됩니다.

사양
최대 길이약 15분
해상도30fps에서 720p
파라미터13.6B
레퍼런스 이미지첫 프레임만 지원(I2V 모드, 캐릭터 레퍼런스 아님)
라이선스MIT
API 비용초당 약 $0.04(fal.ai)

Seaweed APT2

ByteDance의 Seaweed APT2는 다른 접근 방식을 취합니다. 완성된 비디오를 한 번에 생성하는 대신, 단일 H100에서 프레임당 단 0.16초의 지연 시간으로 초당 24프레임을 자기회귀 방식으로 생성합니다. 그 결과 시간적 일관성이 유지되는 최대 5분 길이의 안정적인 비디오를 만들 수 있습니다.

기술적 핵심은 Autoregressive Adversarial Post-Training(AAPT)입니다. 사전 학습된 양방향 비디오 디퓨전 모델을 단방향 자기회귀 생성기로 변환합니다. 프레임당 네트워크 순전파 평가는 한 번만 수행됩니다. 덕분에 실시간 생성이 가능합니다.

이 모델이 단순한 길이 이상의 측면에서 흥미로운 이유는 상호작용성입니다. 비디오가 렌더링되는 동안 카메라를 제어하고, 포즈 감지를 통해 캐릭터를 움직이며, 장면을 조작할 수 있습니다. "비디오 생성"이라기보다 "실시간으로 비디오 연출하기"에 가깝습니다.

제공 방식: 연구 단계에만 머물러 있으며 아직 공개되지 않았습니다. 7B 기반 모델(Seaweed-7B)의 논문은 발표됐지만 APT2 가중치는 공개되지 않았습니다.

사양
최대 길이약 5분
해상도736x416(단일 GPU), 최대 720p(GPU 8개)
파라미터8B
레퍼런스 이미지I2V 및 대화형 포즈 제어를 통해 지원
라이선스미공개
상태연구 프리뷰

Helios

Helios는 Peking University에서 Wan 2.1을 기반으로 제작한 모델입니다. 단일 H100에서 19.5 FPS로 분 단위 비디오를 생성하는 14B 파라미터 모델입니다. 핵심 혁신은 장편 비디오의 드리프트를 처리하는 방식입니다. 셀프 포싱이나 키프레임 샘플링 같은 기존의 드리프트 방지 기법을 사용하는 대신, 학습 중에 드리프트를 시뮬레이션하여 모델이 이를 스스로 보정하도록 학습합니다.

텍스트-투-비디오, 이미지-투-비디오, 비디오-투-비디오 작업을 네이티브로 지원합니다. I2V 모드에서는 생성의 시작점으로 사용할 레퍼런스 이미지를 입력할 수 있습니다.

제공 방식: Apache 2.0 라이선스의 완전한 오픈 소스입니다. 2026년 3월에 공개됐습니다. 코드와 가중치는 GitHub(PKU-YuanGroup/Helios)에서 제공됩니다. Diffusers, SGLang, vLLM-Omni에 통합됐으며 HuggingFace Spaces에서 Gradio 데모를 이용할 수 있습니다.

사양
최대 길이분 단위(고정된 제한 없음)
해상도720p
파라미터14B
레퍼런스 이미지지원(I2V 모드)
라이선스Apache 2.0
하드웨어실시간 생성에 단일 H100 사용

SkyReels V2 / V3

SkyReels V3는 1~4개의 레퍼런스 이미지를 입력받아 멀티숏 전환과 오디오 기반 아바타 합성을 지원하는 무제한 길이의 비디오를 생성합니다.

Skywork의 SkyReels 제품군은 무제한 길이의 비디오를 지향합니다. V2는 고정된 길이 제한 없이 비디오를 생성하는 AutoRegressive Diffusion-Forcing 아키텍처를 사용합니다. 2026년 1월에 공개된 V3는 레퍼런스 이미지-투-비디오, 비디오-투-비디오 연장, 오디오 기반 아바타 생성을 하나의 모델로 통합했습니다.

V3는 1~4개의 레퍼런스 이미지를 입력받아 생성된 비디오 전체에서 피사체의 정체성을 유지합니다. 비디오-투-비디오 모드를 사용하면 매끄러운 단일 숏 이어서 생성과 영화적인 전환을 적용한 멀티숏 전환이 가능합니다.

Skywork는 2026년 2월 25일 SkyReels V4를 발표했습니다. 이 모델은 최대 1080p/32fps로 비디오와 오디오를 함께 생성하고 텍스트, 이미지, 비디오 클립, 마스크, 오디오를 조건 입력으로 받는 듀얼 스트림 모델입니다. 7월에 작성한 내용에서 한 가지 정정할 사항이 있습니다. V4는 오픈 소스로 공개되지 않았습니다. 2026년 9월 현재 SkyworkAI GitHub 조직에는 V1부터 V3 및 Matrix-Game 저장소만 있으며 V4 가중치나 공개 API는 없습니다. 따라서 Skywork의 공개 모델 중 레퍼런스-투-비디오 기능이 가장 뛰어난 모델은 여전히 V3입니다.

제공 방식: 완전한 오픈 소스입니다. 1.3B부터 14B 파라미터까지 다양한 모델이 제공됩니다. 540p와 720p를 지원합니다. 코드와 가중치는 GitHub 및 HuggingFace에서 제공됩니다.

사양
최대 길이무제한(자기회귀)
해상도540p, 720p
파라미터1.3B, 5B, 14B
레퍼런스 이미지이미지 1~4개(V3)
라이선스오픈 소스
하드웨어최소 RTX 4090, 권장 4~8x A100

2등급: 강력한 레퍼런스 및 연장 기능을 지원하는 짧은 클립

이 모델들은 8~60초 길이의 클립을 생성하지만, 강력한 레퍼런스 이미지 지원과 비디오 연장 기능을 제공합니다. 장편 콘텐츠를 만들 때는 모델의 이어서 생성 또는 연장 엔드포인트를 사용해 여러 클립을 연결합니다. 여러 생성 작업에 걸쳐 유지되는 레퍼런스 이미지를 통해 캐릭터 일관성을 확보합니다.

현재 대부분의 크리에이터가 1분 이상의 콘텐츠를 만들 때 사용하는 실용적인 워크플로입니다. 클립 단위 품질은 네이티브 장편 모델보다 뛰어난 경우가 많습니다.

Kling 3.0 Omni(Kuaishou)

Kling 3.0 Omni는 하나의 호출에서 캐릭터 요소, 스타일 레퍼런스, 멀티숏 스토리보딩을 결합하며 네이티브 4K 60fps 출력을 지원합니다.

Kling은 모든 비디오 모델 중 가장 완성도 높은 레퍼런스 이미지 시스템을 갖추고 있습니다. 레퍼런스 입력을 서로 다른 용도의 세 가지 범주로 구분합니다.

레퍼런스 이미지 (image_urls): 스타일과 외형을 안내하기 위한 이미지를 최대 4개까지 사용할 수 있습니다. 프롬프트에서 @Image1, @Image2 등의 형식으로 태그합니다. 첫 프레임으로 사용되는 것이 아니라 전체적인 외관, 장면 스타일, 환경에 영향을 줍니다.

요소 (elements): 전용 캐릭터/오브젝트 입력입니다. 각 요소에는 frontal_image_url(선명한 정면 사진) 하나와 선택 사항인 reference_image_urls(추가 각도의 사진)가 사용됩니다. 프롬프트에서 @Element1, @Element2로 참조합니다. 모델은 캐릭터의 정체성을 추출해 사용자가 묘사한 어떤 장면에든 배치합니다. 모험 영화 스타일의 콘텐츠를 만들 때 핵심적인 기능입니다. 캐릭터 사진을 업로드한 다음 숲을 걷거나, 용과 싸우는 등 원하는 장면을 묘사하면 됩니다.

시작/종료 프레임 (start_image_url, end_image_url): 특정 이미지를 첫 프레임 또는 마지막 프레임으로 고정합니다. 스타일 가이드가 아니라 실제 프레임으로 사용됩니다.

세 범주를 모두 합쳐 최대 7개의 레퍼런스 입력을 사용할 수 있습니다. 레퍼런스 비디오도 사용하는 경우에는 4개로 줄어듭니다. "@Element1 and @Element2 are having dinner at this table on @Image1" 같은 단일 프롬프트로 캐릭터와 장면 레퍼런스를 결합할 수 있습니다.

장편 콘텐츠를 제작할 때 Kling은 두 가지 방법을 제공합니다. 멀티숏 모드는 한 번의 호출로 최대 6개 장면을 생성하며, 장면마다 별도의 프롬프트와 길이(각 3~15초)를 설정할 수 있습니다. 캐릭터 요소는 모든 숏에서 자동으로 유지됩니다. 연장 API는 완성된 비디오가 끝난 지점부터 이어서 생성하며, 연장을 연속으로 적용하면 약 3분까지 만들 수 있습니다. V2V 편집 모드는 기존 비디오(3~10초)를 입력받아 요소 레퍼런스와 텍스트 프롬프트를 사용해 변환합니다. 원본의 카메라 움직임과 캐릭터 배치는 유지하면서 레퍼런스를 바탕으로 캐릭터와 환경의 스타일을 변경합니다. 이 기능 덕분에 Kling은 저품질 3D 렌더링을 비롯한 기존 영상을 개선하는 데 특히 유용합니다.

Kling 3.0 Omni는 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스-투-비디오, 비디오 편집을 하나의 모델로 통합하고 네이티브 오디오 생성과 립싱크를 지원합니다. 2026년 6월 Kuaishou는 더 빠르고 저렴한 변형 모델인 Kling 3.0 Turbo를 추가했습니다. 이 모델은 720p와 1080p에서 오디오를 함께 제공하며, Omni의 편집 파이프라인도 4K 비디오 입출력을 지원하도록 업그레이드됐습니다. 2026년 9월 현재 Kling 3.5나 4.0은 출시되지 않았으므로 3.0 Omni가 여전히 최신 비디오 모델입니다.

제공 방식: Kuaishou, fal.ai, Replicate의 상용 API로 제공되며 해상도와 모델 변형에 따라 초당 요금이 달라집니다. klingai.com에서 웹 인터페이스를 이용할 수 있습니다.

사양
네이티브 클립 길이3~15초
연장 길이약 3분(연속 연장 사용)
해상도720p, 1080p(Omni 편집에서는 4K)
레퍼런스 이미지최대 4개(@Image 스타일 레퍼런스)
요소최대 4개(@Element 정면 및 추가 각도 캐릭터 레퍼런스)
전체 레퍼런스합계 최대 7개(비디오 레퍼런스 사용 시 4개)
멀티숏지원(스토리보드에서 최대 6개 숏)
오디오네이티브 동기화 오디오 및 립싱크
비디오 편집지원(기존 비디오의 텍스트 기반 편집)
APIKuaishou, fal.ai, Replicate

여러 레퍼런스 이미지를 사용하는 Kling 이미지-투-비디오

Kling에 관해 가장 많이 받는 질문이므로, Kling의 VIDEO 3.0 Omni 가이드를 바탕으로 현재 모델에서 멀티 이미지 레퍼런스가 작동하는 방식을 간단히 설명하겠습니다. 표준 이미지-투-비디오는 사진 한 장을 받아 첫 프레임으로 사용하고 애니메이션을 생성합니다. 멀티 이미지 레퍼런스는 별도의 모드입니다. 여러 이미지를 업로드하고 프롬프트에서 태그하면 모델이 이를 조합해 새로운 숏을 구성합니다. 요청에 레퍼런스 비디오가 없으면 이미지와 요소를 합쳐 최대 7개까지 첨부할 수 있고, 레퍼런스 비디오가 있으면 4개로 줄어듭니다. 하나의 캐릭터 요소는 서로 다른 각도에서 촬영한 사진 최대 4장이나 3~8초 길이의 단일 캐릭터 비디오 클립으로 만들 수 있습니다. 또한 5~30초 길이의 음성 녹음을 연결하여 여러 숏에서 캐릭터가 같은 목소리를 유지하도록 할 수 있습니다. 프롬프트에서는 스타일 또는 장면 레퍼런스를 @Image1로, 고정된 캐릭터나 오브젝트는 @Element1 또는 요소에 지정한 이름으로 참조합니다. 따라서 "@Grace walks through @Image1 at dusk" 같은 프롬프트를 사용하면 일관된 캐릭터를 사용자가 제공한 장면에 배치할 수 있습니다. 네이티브 오디오와 함께 720p 또는 1080p로 최대 15초까지 출력할 수 있으며, 동일한 요소 라이브러리를 Kling의 멀티숏 스토리보드에서도 사용할 수 있습니다. 이를 통해 6개 숏으로 구성된 시퀀스 전체에서 하나의 캐릭터를 유지할 수 있습니다. 비디오가 아니라 일관된 스틸 이미지만 필요하다면 Kling IMAGE 3.0이 이미지 가이드에 명시된 대로 최대 10개의 레퍼런스 이미지를 지원합니다. 일반적인 워크플로는 먼저 IMAGE 3.0에서 캐릭터를 고정한 다음, 생성된 스틸 이미지를 요소로 입력하는 것입니다.

Grok Imagine(xAI)

Grok Imagine은 레퍼런스 모드와 첫 프레임 모드를 분리하여 최대 7개의 이미지를 프롬프트에서 캐릭터 또는 오브젝트 레퍼런스로 태그할 수 있게 합니다.
xAI는 2026년 초 Grok Imagine의 Reference-to-Video 모드를 출시했으며, 1~7개의 참조 이미지를 지원합니다. 문서에서는 이 모드를 이미지-투-비디오와 명확히 구분합니다. "원본 이미지가 시작 프레임이 되는 이미지-투-비디오와 달리, 참조 이미지는 첫 프레임을 고정하지 않으면서 영상에 무엇이 등장할지에 영향을 줍니다."

프롬프트에서 이미지를 <IMAGE_1>, <IMAGE_2> 등의 형식으로 태그합니다. "the model from <IMAGE_1> walks onto the runway wearing the shirt from <IMAGE_2>" 같은 프롬프트는 인물 참조와 의상 참조를 결합합니다. 이 모델은 가상 피팅, 제품 배치, 여러 장면에 걸쳐 캐릭터 일관성을 유지하는 스토리텔링을 처리합니다.

한 가지 제약이 있습니다. 동일한 요청에서 참조 이미지와 이미지-투-비디오를 함께 사용할 수 없습니다. 첫 프레임 모드와 참조 모드 중 하나만 선택해야 합니다.

Grok Imagine에는 기존 영상 끝에 새로운 영상을 추가하는 영상 확장 엔드포인트도 있습니다. duration 매개변수는 새로 추가되는 구간만 제어합니다. 확장을 연속으로 적용해 더 긴 콘텐츠를 만들 수 있습니다.

xAI는 2026년 6월 3일 Grok Imagine 1.5를 API 프리뷰로 공개한 뒤, 6월 16일 grok-imagine-video-1.5라는 이름으로 정식 출시했으며 Fast 변형도 소비자용 앱에 순차적으로 배포했습니다. 이 이미지-투-비디오 모델은 하나의 정지 이미지를 카메라 움직임, 분위기, 물리 효과와 함께 영화 같은 움직임으로 애니메이션화하고, 동일한 추론 과정에서 기본 지원되는 동기화 오디오도 생성합니다. 일관된 장면을 연결하는 멀티샷 시퀀싱을 지원하고, 약 25초 만에 6초 길이의 720p 클립을 생성하며, 출시 당시 Artificial Analysis 이미지-투-비디오 아레나에서 3위를 차지했습니다. 2026년 9월 기준 xAI의 모델 페이지에는 Grok Imagine Video 1.5가 초당 $0.08, 기존 Grok Imagine Video가 초당 $0.05로 표시되어 있습니다. xAI의 최신 Grok Imagine Image 2.0은 릴리스 노트에 등재된 정지 이미지 모델로, 애니메이션을 적용하기 전에 캐릭터를 고정하는 데 유용하지만 새로운 영상 모델은 아닙니다.

제공 환경: xAI API(2026년 1월 출시), fal.ai, Replicate. Python SDK, JavaScript/AI SDK 및 REST API. 오디오가 포함된 720p 기준 초당 $0.05. X Premium 구독자도 이용할 수 있습니다.

사양
기본 클립 길이1~15초
확장 길이확장 API를 통해 연속 확장 가능
해상도480p, 720p
참조 이미지1~7개(첫 프레임이 아닌 실제 참조)
프롬프트 태그<IMAGE_1>, <IMAGE_2>
오디오지원(720p)
영상 편집지원(텍스트 기반)
APIxAI API, fal.ai, Replicate
API 비용초당 $0.05(Video), 초당 $0.08(Video 1.5)

Seedance 2.0(ByteDance)

Seedance 2.0은 최대 12개의 멀티모달 입력을 동시에 받아들이며, 8개 이상의 언어에서 기본 오디오 동기화와 음소 단위 립싱크가 적용된 영상을 생성합니다.

ByteDance의 Seedance 2.0은 모든 모델 중 가장 많은 참조 입력을 받습니다. 최대 9개의 이미지, 3개의 영상, 3개의 오디오 파일을 포함해 최대 12개 파일을 동시에 입력할 수 있습니다. 이 모델은 8개 이상의 언어에서 음소 단위 립싱크가 적용되는 기본 오디오-비디오 생성을 지원합니다.

각 이미지는 최대 30MB까지 가능합니다. 참조 영상의 길이는 2~15초여야 합니다. 모델은 참조 자료를 캐릭터 외형, 장면 스타일 및 움직임 가이드에 활용합니다.

이제 그다음 단계도 출시되었습니다. ByteDance는 2026년 6월 23일 Volcano Engine FORCE 컨퍼런스에서 Seedance 2.5를 발표하고 2026년 7월 31일 출시했습니다. Seed 팀의 발표에 따르면, 최대 30초 길이의 단일 기본 클립을 생성하고 여러 차례의 확장을 지원하며, 한 번에 최대 30개의 이미지, 10개의 영상 클립, 10개의 오디오 클립을 참조로 받을 수 있습니다. 이는 기존 12개에서 50개 파일로 늘어난 것입니다. 또한 타임스탬프 단위 편집 기능이 추가되어 클립 전체를 다시 생성하지 않고도 특정 순간만 변경할 수 있습니다. Jimeng과 Doubao에 먼저 적용된 후 BytePlus ModelArk 엔터프라이즈 API에 제공되었으며, 서드파티도 빠르게 도입했습니다. Runway 변경 로그에 따르면 Runway API는 2026년 8월 7일 Seedance 2.5를 추가해 4~30초 길이와 최대 30개의 참조 이미지를 지원하기 시작했습니다. 이 가이드의 내러티브 워크플로에서는 50개의 참조를 활용하는 30초짜리 단일 테이크 덕분에 아래에서 설명하는 클립 연결 작업을 상당 부분 줄일 수 있습니다.

제공 환경: ByteDance 공식 API(Volcengine을 통해 제공, 2026년 2월 출시) 및 서드파티 API 제공업체. API에서는 480p~720p로 출력하며, 플랫폼에서는 최대 2K 시네마 해상도를 지원합니다.

사양
기본 클립 길이4~15초
해상도최대 2K(시네마)
참조 이미지최대 이미지 9개 + 영상 3개 + 오디오 3개(총 12개)
Seedance 2.5 클립 길이기본 최대 30초, 확장 지원
Seedance 2.5 참조최대 이미지 30개 + 영상 10개 + 오디오 10개(총 50개)
오디오기본 지원 및 립싱크(8개 이상의 언어)
APIByteDance/Volcengine, BytePlus ModelArk(2.5), Runway API(2.5), 서드파티 제공업체

Runway Gen-4.5

Runway Gen-4.5는 출시 당시 Artificial Analysis 텍스트-투-비디오 리더보드에서 1,247 ELO로 Veo 3와 Sora 2 Pro를 제치고 1위를 차지했습니다. 2026년 9월에는 아레나 순위가 재편되어 Gemini Omni Flash와 Alibaba의 Wan 3.0이 공동 1위를 차지하고 Gen-4.5는 10위권 밖으로 밀려났지만, Gen-4.5는 여전히 영화 같은 품질과 제어 가능한 액션에 강한 모델이며 Runway는 아직 Gen-5를 출시하지 않았습니다. 이 모델은 텍스트-투-비디오에서 2~10초 길이의 클립을 생성하고, 멀티샷 시퀀싱을 통해 캐릭터 일관성을 유지하는 최대 1분 길이의 장편 영상을 지원합니다.

이미지-투-비디오는 2026년 초 추가되었으며 모든 화면비에서 참조 이미지를 지원합니다. 2026년 Runway의 다른 행보는 새로운 기반 모델보다 편집과 라우팅에 집중되었습니다. Aleph 2.0(2026년 6월 2일)은 텍스트 프롬프트와 특정 타임스탬프에 고정된 최대 5개의 키프레임 이미지를 사용해 기존 2~30초 영상을 편집합니다. Gen-3 Alpha Turbo와 기존 Gen-4 Aleph는 2026년 7월 30일 API에서 지원 종료되었고, 현재 API는 Gemini Omni Flash와 Seedance 2.5를 비롯한 서드파티 모델도 제공합니다. 자세한 내용은 Runway 변경 로그에서 확인할 수 있습니다. 이 모델은 확산 아키텍처에 신경 방사장과 가우시안 스플래팅을 통합해 픽셀 수준 예측을 넘어서는 3D 기하학적 이해 능력을 갖추고 있습니다. 그 결과 객체의 지속성과 물리적으로 타당한 움직임이 향상됩니다.

제공 환경: 상용 API 및 웹 인터페이스. Node 및 Python용 SDK. Replicate에서도 이용할 수 있습니다.

사양
기본 클립 길이2~10초
장편 모드최대 약 1분
해상도최대 1080p
참조 이미지생성당 0~1개
오디오기본 오디오 생성
멀티샷지원
API지원(Runway, Replicate)

Google Veo 3.1

Google의 Veo 3.1은 기본적으로 4초, 6초 또는 8초 길이의 클립을 생성합니다. 현재 프리뷰로 제공되는 "Extend Video" 기능은 클립을 연결해 약 1~2.5분까지 늘릴 수 있지만, 시퀀스가 길어질수록 일관성이 흔들릴 수 있습니다.

"Ingredients to Video" 기능은 최대 3개의 참조 이미지를 입력으로 받습니다. 애니메이션화할 캐릭터, 배경 및 재질 텍스처를 제공할 수 있습니다. 참조 이미지를 사용하면 모델이 시각적 참조를 더 충실히 따르고 임의 변경을 덜 적용합니다. 한 가지 제한 사항은 참조 이미지 모드가 8초 길이 옵션에서만 작동한다는 점입니다.

2026년 1월 Veo 3.1에는 참조 기반 생성을 위한 세로 영상(9:16)과 Vertex AI의 4K 업스케일링이 추가되었습니다. 이어 Google은 2026년 3월 31일 가장 저렴한 영상 모델인 Veo 3.1 Lite를 출시하고, 2026년 6월 30일 Veo 2.0과 3.0의 지원을 종료했습니다. Gemini API 변경 로그에 따르면 2026년 9월 현재 Veo 4는 발표되지 않았습니다. Google의 최신 영상 기술 개발은 아래에서 다루는 Gemini Omni Flash에 집중되고 있습니다.

제공 환경: Google Vertex AI API, Gemini API 및 Google Flow. Google Cloud 계정이 필요합니다.

사양
기본 클립 길이4초, 6초 또는 8초
확장 길이약 1~2.5분
해상도최대 4K(업스케일링 사용)
참조 이미지최대 3개("Ingredients to Video")
오디오동기화된 대화 및 음악
APIVertex AI, Gemini API

Google Gemini Omni Flash

Google은 2026년 5월 I/O에서 Gemini Omni 제품군을 발표하고 첫 번째 모델로 Gemini Omni Flash를 출시했습니다. 이 모델은 빠르게 Veo 3.1을 제치고 Artificial Analysis 아레나 1위를 차지했습니다. 핵심은 대화형 영상 제작입니다. 텍스트, 이미지 또는 영상으로 10초짜리 클립을 생성한 다음, 서로 이어지는 후속 지시를 통해 편집할 수 있습니다. 처음부터 다시 생성하지 않고도 조명을 바꾸고, 의상을 교체하고, 카메라를 조정할 수 있습니다.

참조 지원 측면에서 Omni Flash는 이미지와 짧은 영상 클립을 스타일, 움직임 및 효과 참조로 받으며, 오디오 참조도 지원할 예정입니다. 대화형 편집 과정에서 캐릭터 일관성이 유지되지만, Google 공식 문서에서도 장면 전환과 카메라 패닝 중에는 일관성이 깨질 수 있다고 설명합니다. 따라서 캐릭터 비중이 높은 결과물은 출시 전에 검토해야 합니다.

제공 환경: API(gemini-omni-flash-preview)는 2026년 6월 30일 Google AI Studio와 Gemini API를 통해 공개 프리뷰로 제공되기 시작했으며, 출력 영상 기준 초당 약 $0.10입니다. Gemini API 변경 로그에 따르면 gemini-omni-1.1-flash는 영상 확장, 보간 및 해상도 제어 기능과 함께 2026년 8월 27일 정식 출시되었습니다. 모든 클립에는 SynthID 워터마크가 적용됩니다. 소비자는 Gemini 앱, Google Flow 및 YouTube Shorts를 통해 이용할 수 있으며, Runway API도 이 모델로 라우팅합니다.

사양
기본 클립 길이10초(더 긴 길이 지원 예정)
해상도720p
참조 입력이미지 + 짧은 영상 클립(오디오 지원 예정)
편집대화형, 반복 편집
오디오기본 지원
APIGemini API(gemini-omni-1.1-flash로 정식 출시), 초당 약 $0.10

OpenAI Sora 2 / Sora 2 Pro

지원 종료 예정(2026년): OpenAI는 Sora를 단계적으로 종료하고 있습니다. OpenAI의 지원 종료 페이지에 따르면 소비자용 Sora 앱은 2026년 4월 26일 종료되었고, Sora 2 API는 2026년 9월 24일 종료되며 발표된 후속 모델은 없습니다. 아래 기능은 여전히 주목할 만하지만 Sora를 기반으로 새 파이프라인을 구축해서는 안 됩니다. 대신 Kling, Grok Imagine 또는 오픈 모델을 사용하세요.

Sora 2 Pro는 최대 20초 길이의 클립을 생성합니다. Characters API는 Kling이나 Grok과 다른 방식을 사용합니다. 정지 이미지를 업로드하는 대신, 1~3초의 타임스탬프 범위를 지정한 영상 클립을 API에 전달해 character_id를 생성합니다. Sora는 영상 프레임을 분석해 얼굴 구조, 신체 비율, 의상 스타일 및 기타 식별 특징을 추출합니다. 이 character_id는 무기한 유지되며 이후 무제한으로 재사용할 수 있습니다.

생성당 업로드된 캐릭터를 최대 2개까지 참조할 수 있습니다. 2026년 3월부터 캐릭터 참조는 사람뿐 아니라 사물과 동물에도 적용됩니다. 영상 확장에서는 전체 초기 클립을 후속 영상 생성을 위한 컨텍스트로 사용합니다.

캐릭터 시스템에서 캐릭터를 생성하려면 정지 이미지가 아닌 영상 입력이 필요합니다. 사진만 있다면 먼저 짧은 영상을 생성한 다음 해당 영상에서 캐릭터를 추출해야 합니다.

제공 환경: 프로덕션 워크플로용 Batch API를 지원하는 OpenAI API.

사양
기본 클립 길이최대 20초
해상도최대 1920x1080
캐릭터 참조생성당 최대 2개(영구적인 character_id)
캐릭터 입력정지 이미지가 아닌 영상 클립(1~3초 타임스탬프 범위)
오디오동기화
확장지원(전체 클립을 컨텍스트로 사용)
APIOpenAI API + Batch API

MiniMax Hailuo 02

Hailuo 02는 출시 당시 Artificial Analysis 벤치마크에서 Veo 3를 제치고 세계 2위를 기록했습니다. 업계 최고 수준의 물리 시뮬레이션을 적용해 기본 1080p로 10초 길이의 클립을 생성합니다. 이 모델은 체조나 곡예 같은 격렬한 움직임도 형태가 무너지지 않도록 처리합니다.

얼굴 인식과 신체 추적을 통해 강력한 캐릭터 일관성을 유지하는 이미지-투-비디오 생성을 지원합니다. Noise-aware Compute Redistribution 아키텍처는 장면 복잡도에 따라 컴퓨팅 자원을 동적으로 할당합니다.

이후 MiniMax는 물리적 동작, 스타일화 및 캐릭터의 미세 표정을 개선한 Hailuo 2.3 제품군(Standard, Pro, Fast, Fast Pro)을 출시하며 Hailuo 02를 넘어섰습니다. 6초 영상은 1080p, 10초 영상은 768p로 출력하며 MiniMax 플랫폼과 fal.ai에서 이용할 수 있습니다.

제공 환경: 상용 API. MiniMax 플랫폼, fal.ai 및 Replicate를 통해 이용할 수 있습니다. 영상당 $0.28입니다.

사양
기본 클립 길이최대 10초
해상도기본 1080p
참조 이미지지원(I2V 모드)
오디오기본 미지원
물리 효과동급 최고 수준의 시뮬레이션
APIMiniMax, fal.ai, Replicate

MiniMax H3(Hailuo 3.0)

MiniMax는 2026년 7월 31일 Hailuo 2.x 제품군을 MiniMax H3로 대체했으며, 이로 인해 이 가이드에서 Hailuo의 위상도 달라졌습니다. Hailuo 02가 첫 프레임 모델이었던 것과 달리 H3는 옴니모달 모델입니다. MiniMax의 발표에 따르면 단일 트랜스포머가 텍스트, 이미지, 영상 및 오디오를 함께 읽고 기본 스테레오 오디오가 포함된 4~15초 길이의 클립을 최대 2K로 출력합니다. 참조 모드인 Ref2VA는 최대 9개의 참조 이미지, 3개의 참조 영상 클립 및 3개의 오디오 클립을 받으며 총 12개 파일로 제한됩니다. 따라서 Kling 및 Seedance 2.0과 같은 실제 참조 모델 범주에 속합니다. 첫 프레임과 마지막 프레임 모드인 FL2VA는 기존 키프레임 워크플로를 지원합니다. 2026년 9월 기준 Artificial Analysis 텍스트-투-비디오 아레나에서 H3와 H3 Max는 Omni Flash 및 Wan 3.0 바로 다음 순위에 있습니다. 셀프 호스팅 사용자에게 더 큰 소식은 MiniMax가 2026년 8월에 33B 베이스 가중치를 FL2VA 및 Ref2VA 체크포인트와 함께 Hugging Face에 공개했다는 점입니다. 라이선스는 MiniMax H3 Community License이며, 모델 카드에서는 미국, EU, 영국, 한국 사용자가 이용 전에 신청서를 제출하도록 요구합니다. 따라서 Apache 스타일의 완전한 오픈 모델이라기보다는 지역별 조건이 붙은 오픈 모델입니다.

이용 가능 환경: MiniMax API 및 플랫폼, fal.ai와 기타 호스팅 서비스, 다운로드 가능한 가중치.

사양
네이티브 클립 길이4~15초
해상도최대 2K(기본 짧은 변 768p)
참조 이미지최대 이미지 9개 + 동영상 3개 + 오디오 3개(총 12개, Ref2VA)
키프레임첫 프레임 및/또는 마지막 프레임(FL2VA)
오디오네이티브 스테레오, 32kHz
오픈 가중치예, 33B, MiniMax H3 Community License(미국/EU/영국/한국은 신청 필요)
APIMiniMax, fal.ai

Luma Ray3.2

Luma의 Ray2는 Ray3 제품군으로 대체되었습니다. Ray3(2025년 9월)는 신원 고정을 위한 Character Reference와 동영상 변환용 Modify 모드를 추가했으며, Ray3.2(2026년 6월 9일)는 클립당 최대 16개 키프레임을 사용하는 프레임 단위 제어, Reframe 기능, 최대 20초 길이의 클립을 추가했습니다. 또한 Ray3 제품군 최초로 공개 API를 제공했습니다. 출력은 네이티브 1080p이며, Hi-Fi 업스케일을 통해 4K를 지원합니다. 이미지 투 비디오는 참조 이미지를 시작 또는 종료 키프레임으로 사용할 수 있습니다.

이용 가능 환경: Luma API 및 웹 인터페이스.

사양
네이티브 클립 길이최대 20초(Ray3.2)
참조 유형시작/종료 키프레임 + Character Reference(신원)
해상도네이티브 1080p, 업스케일로 4K
참조 이미지지원(키프레임 + 캐릭터 참조)
APILuma API

Pika 2.5

Pika는 Pikaframes를 통해 키프레임 기반 접근 방식을 사용합니다. 2~5개의 키프레임(핵심 시점의 참조 이미지)을 업로드하면 모델이 그 사이를 부드럽게 전환하는 영상을 생성합니다. 전체 길이는 20~25초에 달합니다.

Pikascenes는 최대 10개의 참조 이미지를 받아 하나의 동영상으로 결합합니다. 모델은 이미지 인식을 통해 각 참조의 역할(캐릭터, 배경, 소품)을 자동으로 파악합니다.

이용 가능 환경: Pika 웹 플랫폼 및 API. 무료부터 Pro까지 구독 요금제를 제공합니다.

사양
네이티브 클립 길이5~10초
Pikaframes 길이20~25초
해상도최대 1080p
참조 이미지최대 10개(Pikascenes), 키프레임 2~5개(Pikaframes)
API지원

Vidu Q3(ShengShu)

Vidu는 이 가이드의 이전 버전에는 없었던 별도 섹션을 둘 만합니다. Q3 제품군이 현재 이용 가능한 가장 강력한 피사체 참조 시스템 중 하나로 자리 잡았기 때문입니다. ShengShu는 2026년 초 네이티브 오디오와 최대 16초 클립을 지원하는 Vidu Q3를 출시했으며, 출시 발표에 따르면 2026년 4월 13일 Q3 Reference-to-Video를 추가했습니다. 참조 모드는 피사체, 환경, 의상, 소품, 시각적 스타일을 하나의 요청에서 결합합니다. Vidu API 문서에 따르면 reference2video 엔드포인트는 최대 7개의 참조 이미지를 받으며, 프롬프트에서 @1, @2와 같은 태그로 지정합니다("@1과 @2가 함께 요리하고 있다"). viduq3의 영상 길이는 3~16초이고, 해상도는 최대 1080p이며, 플래그를 통해 오디오 생성을 설정합니다. 또한 하나의 클립 안에서 지능적으로 카메라를 전환할 수 있는데, 이는 흔치 않으며 대화 장면에 유용합니다. ShengShu에 따르면 Q3는 SuperCLUE가 처음 실시한 Reference-to-Video 리더보드에서 1위를 차지했습니다. 또한 이 가이드를 처음 작성했을 당시에도 Vidu는 VBench 2.0에서 Veo를 바짝 추격한 모델이었습니다.

이용 가능 환경: Vidu 웹 앱 및 API(viduq3, viduq3-turbo), Alibaba Cloud Model Studio, 서드파티 호스팅 서비스.

사양
네이티브 클립 길이3~16초
해상도최대 1080p
참조 이미지최대 7개(@1, @2 태그)
참조 유형피사체, 환경, 소품, 의상, 스타일
오디오네이티브(효과음, 대사, 음악)
APIVidu API, Alibaba Cloud Model Studio

티어 3: 셀프 호스팅 워크플로용 오픈 소스 모델

이 모델들은 더 짧은 클립을 생성하지만 완전히 개방되어 있습니다. 자체 하드웨어에서 실행하고 파인튜닝하며, API에 의존하지 않는 맞춤형 연장 파이프라인을 구축할 수 있습니다.

Wan 2.1(Alibaba)

Wan 2.1은 Helios를 비롯한 여러 모델의 기반입니다. Wan-VAE 아키텍처는 시간적 정보를 보존하면서 길이에 관계없이 1080p 동영상을 인코딩하고 디코딩합니다. 이 모델은 480p 및 720p I2V 변형과 두 참조 이미지 사이의 영상을 생성하는 First-Last-Frame-to-Video 모델로 제공됩니다.

Wan-Edit은 특정 구조나 캐릭터 포즈를 유지하면서 참조 이미지를 사용해 스타일과 콘텐츠를 전이할 수 있습니다. Wan 2.2(2025년 7월)는 더 최신 오픈 릴리스로, 단일 RTX 4090에서 실행되는 5B 변형을 갖춘 Mixture-of-Experts 모델이며 여전히 Apache 2.0 라이선스를 따릅니다. 셀프 호스팅 사용자에게 중요한 주의점이 하나 있습니다. Wan은 2.5부터 비공개 모델로 전환되었습니다. 이후 Wan 2.5, 2.6, 2.7, 그리고 현재의 Wan 3.0은 동기화된 오디오와 더 높은 해상도를 추가했지만 공개 가중치 없이 API로만 제공되므로, 2.2가 여전히 오픈 버전의 상한선입니다. Wan 3.0은 2026년 8월 Alibaba Cloud Model Studio에 출시되었으며, 모델 페이지에 따르면 텍스트, 이미지, 동영상, 오디오 참조를 바탕으로 480p, 720p 또는 1080p 영상을 한 번에 최대 30초까지 생성합니다. 2026년 9월 기준 Artificial Analysis 텍스트 투 비디오 아레나에서 Gemini Omni Flash와 공동 1위를 차지하고 있습니다. 다운로드 가능한 모델이 아니라 호스팅 제품입니다. Wan 2.7 또는 3.0 가중치를 다운로드할 수 있다고 주장하는 SEO 페이지는 무시하세요. 공식 GitHub 조직과 Hugging Face 계정에는 2.2까지만 공개되어 있습니다. 최신 업로드도 Wan2.2-Animate 업데이트입니다.

사양
파라미터1.3B, 5B, 14B(2.1); 5B + 14B MoE(2.2)
I2V 모드I2V-480P, I2V-720P, FLF2V-720P
오픈 버전 상한선Wan 2.2(2.5~3.0은 API 전용)
라이선스Apache 2.0
하드웨어8GB 이상 VRAM(소형 변형)
플랫폼Diffusers, ComfyUI

HunyuanVideo(Tencent)

Tencent의 13B 파라미터 모델은 2025년 대부분의 기간 동안 오픈 소스 동영상 생성 분야를 선도했습니다. HunyuanVideo-I2V는 사전 학습된 MLLM과 토큰 교체 기법을 사용해 참조 이미지 정보를 반영합니다. 2025년 11월 출시된 HunyuanVideo-1.5는 효율성을 개선했습니다. HunyuanCustom은 멀티모달 입력 기반의 맞춤형 동영상 생성을 지원합니다.

사양
파라미터13B
I2V지원(토큰 교체 기법)
라이선스오픈 소스
하드웨어60GB 이상 VRAM(720p)
변형Base, I2V, 1.5, Avatar, Custom

LTX-2(Lightricks)

Lightricks는 2026년 1월 전체 가중치, 추론 코드, 학습 코드와 함께 LTX-2를 오픈 소스로 공개했습니다. 한 번의 패스로 동영상과 동기화된 오디오를 함께 생성하는 DiT 기반 모델이며, 네이티브 4K, 최대 50fps, 최대 20초 길이의 클립을 지원합니다. 이미지 투 비디오와 멀티 키프레임 조건 지정 기능이 내장되어 있어 Pikaframes처럼 클립 내 여러 지점에 참조 스틸 이미지를 고정할 수 있습니다.

라이선스가 제한 요소일 수도 있고, 규모에 따라 아닐 수도 있습니다. LTX-2는 연구 목적 및 연간 매출 $10M 미만의 상업적 이용에는 무료입니다. 이를 초과하면 상업용 라이선스가 필요하므로, 엄밀히 말하면 오픈 소스가 아니라 오픈 가중치 모델입니다. LTX-2.3은 오디오와 프롬프트 준수 성능을 개선한 22B 파라미터 업데이트였습니다. 2026년 9월 기준 최신 체크포인트인 LTX-2.5는 22B 규모를 유지하면서 여러 개의 연결된 숏 전반에서 동일한 캐릭터와 룩을 유지하는 네이티브 멀티숏 생성 기능, 단순 VAE 복원을 대체하는 확산 동영상 디코더, 긴 프롬프트를 위한 Gemma 4 12B 텍스트 인코더를 추가했습니다. 여전히 동일한 연 매출 $10M 기준이 적용되는 LTX-2.x Community License를 따릅니다. Hugging Face에서 증류 변형, LoRA 어댑터, ComfyUI 및 Diffusers 통합과 함께 가중치를 제공하며, 호스팅 API는 LTX 플랫폼, fal.ai, Replicate에서 실행됩니다.

사양
파라미터22B(LTX-2.3 및 LTX-2.5)
최대 클립약 20초
해상도네이티브 4K, 최대 50fps
오디오네이티브 동기화
I2V지원(이미지 + 멀티 키프레임 조건 지정)
라이선스LTX-2 Community License(연 매출 $10M 미만 무료)
하드웨어소비자용 GPU를 위한 증류 및 FP8 변형

CogVideoX(Tsinghua/Zhipu AI)

CogVideoX는 시퀀스 길이를 줄이고 깜빡임을 방지하는 3D 인과적 VAE를 사용합니다. 적응형 LayerNorm 트랜스포머는 텍스트와 동영상의 정렬 성능을 향상합니다. 네이티브 Diffusers 통합과 함께 2B(Apache 2.0) 및 5B(연구용 라이선스) 변형으로 제공됩니다.

클립은 720x480 해상도로 6~10초입니다. 짧지만 연산량 대비 품질이 좋으며 12GB GPU에서 실행됩니다.

사양
파라미터2B, 5B
I2V지원(CogVideoXImageToVideoPipeline)
해상도8fps에서 720x480
라이선스Apache 2.0(2B), 연구용(5B)
하드웨어12GB VRAM

첫 프레임과 진정한 참조의 차이: 핵심 구분

모든 "참조 이미지" 지원이 동일한 것은 아닙니다. 올바른 모델을 선택하려면 그 차이를 이해하는 것이 중요합니다.

첫 프레임 모델(LongCat, Helios, Hailuo, Luma Ray2, HunyuanVideo)은 이미지를 실제 시작 프레임으로 취급합니다. 모델은 그 시각적 상태 그대로부터 이후 움직임을 생성합니다. 캐릭터의 얼굴 사진을 업로드한 뒤 다른 장면에 등장하도록 설명할 수는 없습니다. 이미지 자체가 곧 장면입니다.

진정한 참조 모델(Kling, Grok Imagine, Seedance, Vidu Q3, MiniMax H3, SkyReels V3)은 이미지에서 신원을 추출한 뒤, 설명한 어떤 장면에도 해당 캐릭터나 객체를 배치합니다. 사람 사진을 업로드하고 "그 사람이 해 질 녘 숲속을 걷는다"고 프롬프트를 입력할 수 있습니다. 캐릭터는 신원을 유지하면서 완전히 새로운 환경에 나타납니다. 모험 영화처럼 여러 장면으로 이루어진 서사형 콘텐츠에 필요한 기능입니다.

캐릭터 ID 모델(Sora 2 Pro)은 정지 이미지가 아니라 동영상 클립에서 신원을 추출합니다. 영구적인 캐릭터 ID를 한 번 생성한 뒤 이후 무제한 생성에서 재사용할 수 있습니다.

스타일/재료 모델(Veo 3.1)은 특정 캐릭터의 신원을 추출하기보다 참조 이미지를 사용해 시각적 스타일, 텍스처, 전체적인 룩에 영향을 줍니다. 프로젝트 전반의 시각적 일관성을 유지하는 데는 적합하지만 개별 캐릭터를 정밀하게 제어하는 데는 덜 적합합니다.

10분 동영상을 위한 실제 워크플로

2026년 중반 현재 상황을 솔직히 말하면, 단일 모델로 일관된 고품질 동영상 10분을 한 번에 안정적으로 생성할 수는 없습니다. LongCat Video가 최대 15분을 주장하며 가장 근접했지만, 그 정도 길이에서는 품질과 일관성이 크게 달라집니다. Helios와 SkyReels V2는 각각 "분 단위" 및 "무한 길이" 동영상을 생성하지만, 결과를 얻으려면 신중한 프롬프트 작성과 여러 차례의 시도가 필요한 경우가 많습니다.

대부분의 크리에이터가 5~15분 동영상을 제작할 때 실제로 효과를 보는 워크플로는 여러 접근 방식을 결합합니다.

토킹 헤드/아바타 콘텐츠: LongCat Video의 2026년 오디오 구동 모드나 SkyReels V3의 아바타 생성 기능은 일관된 말하는 캐릭터를 5분 이상 생성할 수 있습니다. "버튼을 누르면 긴 동영상이 나오는" 방식에 가장 가깝습니다.

여러 장면으로 구성된 서사형 콘텐츠(모험 영화 스타일): Kling 3.0, Grok Imagine 또는 Seedance 2.0과 진정한 캐릭터 참조 이미지를 사용하세요. 각각 10~15초 길이의 숏을 생성합니다. 모든 생성에서 동일한 @Element 또는 <IMAGE> 참조를 사용해 캐릭터 신원을 유지하세요. 멀티숏 모드(Kling은 호출당 6개 숏 지원) 또는 연장 API를 사용해 숏을 연결합니다. Kling은 이 워크플로에서 가장 충분히 검증된 모델입니다. "참조 모드"와 "첫 프레임 모드"가 명확히 분리된 Grok Imagine도 강력한 대안입니다. Seedance 2.5는 현재 가장 많은 참조 입력(파일 50개)을 받고 30초 분량을 생성하므로 이어 붙여야 하는 횟수를 대략 절반으로 줄여 줍니다. @ 태그로 참조 7개를 사용하는 Vidu Q3와 파일 12개를 사용하는 MiniMax H3도 신뢰할 만한 최신 선택지입니다.

여러 클립에서 캐릭터 일관성 유지: Sora 2 Pro의 영구 character_id 시스템은 매우 긴 프로젝트에 가장 깔끔한 접근 방식입니다. 짧은 동영상에서 캐릭터를 한 번 추출한 다음 해당 ID를 참조하여 수십 개의 클립을 생성합니다. 매번 이미지에서 신원을 다시 해석하는 대신 영구 임베딩으로 저장되므로 시간이 지나도 캐릭터 신원이 흐트러지지 않습니다.

스타일 전이 콘텐츠: fal.ai의 Lucy Restyle은 기존 동영상을 최대 30분까지 처리하여 움직임을 보존하면서 AI 스타일 변환을 적용합니다. 원본 영상이 있다면 생성 길이 문제를 완전히 우회할 수 있습니다. 원본 동영상 기준 초당 $0.01입니다.

오픈 소스 파이프라인: Wan 2.2 또는 Helios를 기반으로 동영상 연장 루프를 구축하세요. 커뮤니티 라이선스를 해당 지역에서 사용할 수 있다면 이미지 9개 참조 모드를 갖춘 최초의 오픈 모델인 MiniMax H3의 Ref2VA 체크포인트를 활용할 수도 있습니다. 클립을 생성하고, 마지막 프레임을 다음 클립의 시작 프레임으로 사용한 뒤 반복합니다. ComfyUI 워크플로로 이를 자동화할 수 있습니다. 여러 차례 반복하면 일관성이 저하되지만 무료이고 제어할 수 있습니다.

핵심 과제는 여전히 남아 있습니다. 진정한 참조 이미지를 지원하더라도 수십 개의 클립을 거치면서 캐릭터 드리프트가 누적됩니다. 얼굴 특징, 머리카락, 의상, 피부색이 점차 달라집니다. 고품질 참조 사진, 일관된 프롬프트, 숏 일괄 생성 같은 우회책이 필요합니다. 하지만 캐릭터 신원과 장면 구성을 분리하는 Kling 및 Grok Imagine 같은 모델을 사용하면 첫 프레임 전용 모델보다 이 작업이 훨씬 쉬워집니다.

3D 스캐폴드 접근 방식: 낮은 품질로 렌더링하고 높은 품질로 변환하기

장편 생성 문제 대부분을 완전히 우회하는 워크플로가 주목받고 있습니다. AI 모델에 10분 분량의 동영상을 처음부터 생성하도록 요청하는 대신, 올바른 카메라 연출, 캐릭터 블로킹, 타이밍을 갖춘 저충실도 3D 컷신을 렌더링한 다음 참조 이미지 및 향상 프롬프트와 함께 비디오 투 비디오 모델로 처리하는 방식입니다. 3D 엔진은 구조를 담당하고 AI는 미학을 담당합니다. 이는 V2V 변환이 완전한 생성보다 범위가 좁은 문제이기 때문에 가능합니다. 모델은 카메라 움직임, 캐릭터 배치, 장면 구도를 새로 만들어낼 필요가 없습니다. 시각적 레퍼런스를 따르면서 기존 영상을 사실적으로 보이게 만들기만 하면 됩니다. 이는 훨씬 다루기 쉬운 문제이며, 3D 엔진이 렌더링할 수 있는 길이라면 얼마든지 확장할 수 있습니다.

이 방식이 효과적인 이유

3D 엔진은 AI 영상 모델이 여전히 어려워하는 모든 요소를 제공합니다. 정밀한 카메라 제어, 프레임 전반에 걸친 정확한 캐릭터 배치, 올바른 물리 상호작용, 몇 분 길이의 영상에서도 일관된 타이밍을 구현할 수 있습니다. 달리 줌, 트래킹 숏, 정해진 타이밍에 프레임 안으로 들어오고 나가는 캐릭터는 모두 3D 엔진에서는 간단하지만 텍스트 프롬프트 기반 생성에서는 신뢰하기 어렵습니다. V2V 모델이 할 일은 이미 정의된 지오메트리와 움직임을 유지하면서 재질, 조명, 텍스처를 사실적인 결과물로 변환하는 것뿐입니다.

캐릭터 일관성도 확보하기 쉬워집니다. 서로 분리된 50개의 AI 생성 결과에서 정체성 드리프트와 씨름하는 대신, 모든 프레임에서 동일한 3D 캐릭터를 모델에 보여주는 방식입니다. 레퍼런스 이미지는 최종 결과에서 해당 캐릭터가 어떤 모습이어야 하는지 모델에 알려줍니다. 매번 일관된 캐릭터를 처음부터 생성하는 것보다 훨씬 간단한 문제입니다.

길이도 더 이상 제약이 아닙니다. Lucy Restyle은 한 번의 호출로 30분을 처리합니다. ComfyUI의 Wan 2.1은 어떤 길이든 청크 단위로 처리할 수 있습니다. 영상이 이미 존재하므로 “10분짜리 영상을 어떻게 생성하지?”라는 문제와 애초에 씨름할 필요가 없습니다.

RealMaster (Meta / 텔아비브 대학교)

RealMaster는 이 워크플로를 위해 특별히 구축된 연구 시스템입니다. Meta Reality Labs와 텔아비브 대학교가 2026년 3월에 발표했으며, 소스와의 완전한 기하학적 정렬을 유지하면서 렌더링된 3D 영상을 사실적인 영상으로 변환합니다.

이 방식은 구조와 움직임을 보존하기 위해 3D 렌더에서 에지 맵을 추출한 다음, VACE/Wan 아키텍처를 기반으로 구축된 영상 확산 모델을 적용해 나머지 모든 요소를 사실적인 결과물로 변환합니다. 경량 IC-LoRA 어댑터는 파이프라인을 앵커 프레임이 필요 없는 단일 추론 패스로 증류하며, 시퀀스 중간에 나타나는 객체도 처리합니다.

GTA-V 및 CARLA 시뮬레이터 시퀀스로 테스트한 결과, RealMaster는 범용 영상 편집 베이스라인을 크게 능가했습니다. 사실성 변환 위에 텍스트 프롬프트를 통해 날씨 효과(“비가 내리게 해줘”, “눈이 내리게 해줘”)를 추가할 수도 있습니다. 모델은 재훈련 없이 여러 시뮬레이터에 일반화됩니다. GTA-V 데이터로 훈련된 가중치를 추가 튜닝 없이 CARLA 출력에 사용할 수 있습니다.

이용 가능 여부: 연구 전용입니다. 아직 공개 가중치나 API는 없습니다.

사양
입력렌더링된 3D 영상(모든 엔진)
출력지오메트리와 움직임을 보존한 사실적 영상
아키텍처VACE/Wan 영상 확산 백본 기반 IC-LoRA
컨디셔닝소스 렌더의 에지 맵
테스트 환경GTA-V, CARLA 시뮬레이터
라이선스미공개(연구 논문만 제공)

현재 이용 가능한 프로덕션용 V2V 도구

요소 레퍼런스를 지원하는 Kling 3.0 V2V는 가장 완성도 높은 프로덕션 옵션입니다. fal.ai의 Edit Video 및 Reference V2V 엔드포인트는 3~10초 길이의 소스 영상 클립과 함께 요소 레퍼런스(@Element1, @Element2 및 정면·다각도 사진), 개선 프롬프트를 입력받습니다. 모델은 소스의 움직임 궤적과 카메라 패턴을 분석한 다음, 원래의 스테이징과 카메라 워크를 보존하면서 지정한 캐릭터 외형과 시각적 스타일로 영상을 재생성합니다. 최대 7개의 레퍼런스 입력을 지원하며, 출력은 1080p입니다. 컷신을 10~15초 청크로 나누고 모든 청크에 동일한 요소 레퍼런스를 사용하면 캐릭터 일관성을 유지할 수 있습니다.

Lucy Restyle 2는 한 번의 API 호출로 최대 30분 길이의 소스 영상을 처리하며, 입력 1초당 비용은 $0.01입니다. 텍스트 프롬프트와 스타일 가이드를 위한 선택적 레퍼런스 이미지를 입력받습니다. Kling처럼 캐릭터별 요소 레퍼런스는 지원하지 않지만, 전체 길이의 3D 렌더에 전반적인 시네마틱 스타일을 적용할 때 가장 간단하고 저렴한 방법입니다. 완성된 렌더 전체와 목표 스타일을 설명하는 프롬프트를 입력하면 됩니다. 수천 프레임에 걸쳐 시간적 일관성을 유지한 720p 결과를 출력합니다.

ComfyUI의 Wan 2.1 VACE는 오픈 소스 방식입니다. 14B VACE 모델은 레퍼런스 기반 V2V를 수행합니다. 소스 영상과 스타일 레퍼런스 이미지를 입력하면 구조와 움직임을 보존한 리스타일링 버전을 출력합니다. 에지 맵 컨디셔닝은 구조적 충실도를 높입니다. 일관된 스타일 레퍼런스를 사용해 어떤 길이든 청크 단위로 처리하는 루프를 구축할 수 있습니다. 무료이며 자체 하드웨어에서 로컬로 실행됩니다.

Grok Imagine V2V는 레퍼런스 모드에서 소스 영상과 1~7개의 레퍼런스 이미지를 입력받습니다. 720p 기준 초당 $0.05입니다. 레퍼런스 모드와 첫 프레임 모드가 명확히 분리되어 있으므로, 레퍼런스가 소스 영상의 구조를 덮어쓰지 않으면서 캐릭터 외형을 안내합니다.

3D 렌더에 필요한 요소

렌더 품질의 최저 기준은 중요합니다. 단순한 와이어프레임만으로는 V2V 모델이 작업하기에 충분한 정보를 제공할 수 없습니다. 그렇다고 프로덕션 수준의 재질이나 조명이 필요한 것은 아닙니다.

올바른 비율과 지오메트리. 레퍼런스 이미지가 제대로 매핑되려면 캐릭터 모델의 신체 비율과 얼굴 구조가 대략적으로 정확해야 합니다. 비율이 올바른 기본 휴머노이드 지오메트리면 충분합니다. 막대 인간으로는 알아볼 수 있는 캐릭터를 만들 수 없습니다.

기본적인 조명 방향. 장면의 전반적인 조도를 설정하는 단일 방향광은 모델이 의도된 분위기를 이해하는 데 도움이 됩니다. AI가 디테일을 강화하고 추가하더라도, 장면이 밝은 대낮인지 어두운 실내인지 알아야 합니다.

부드러운 카메라 움직임. 안정적이고 의도적인 카메라 움직임은 결과에 잘 반영됩니다. 불규칙하거나 지나치게 빠른 움직임은 V2V 모델을 혼란스럽게 할 수 있습니다. 가상 카메라가 실제 카메라처럼 움직이도록 설정하세요.

와이어프레임보다 플랫 셰이딩. 단순한 플랫 셰이딩이나 로우폴리 지오메트리가 와이어프레임 또는 텍스처 없는 모델보다 더 좋은 결과를 냅니다. 표면에 기본 단색만 적용해도 모델이 재질 경계를 이해하는 데 도움이 됩니다.

비용과 규모

여러 도구로 10분짜리 컷신을 처리할 때의 비용입니다.

도구최대 입력 길이10분 처리 비용해상도레퍼런스 이미지
Kling O3 V2V10초 클립~$50-671080p최대 7개(요소 + 스타일)
Lucy Restyle 230분$6720p1개(스타일만)
Grok Imagine V2V10초 클립~$30720p1~7개
Wan 2.1 VACE제한 없음(청크 처리)무료(로컬 GPU)720p청크당 1개

이 수치는 2026년 중반에 처음 비교했을 당시 공급업체의 정가를 바탕으로 산정한 추정치이며, 공급업체는 가격을 자주 변경합니다. 따라서 견적이 아니라 상대적 순위로 받아들이세요. 전체 길이 처리에는 Lucy Restyle이 가장 저렴합니다. 캐릭터별 요소 레퍼런스를 활용한 정밀한 개선에는 Kling이 가장 적합합니다. Wan 2.1은 필요한 하드웨어가 있다면 무료입니다. 720p에서 14B 모델을 실행하려면 약 60GB VRAM이 필요하며, 품질이 낮은 1.3B 변형은 8GB가 필요합니다.

비교표

모델최대 기본 길이확장 길이레퍼런스 유형최대 레퍼런스 수해상도API 제공오픈 소스
LongCat Video~15분해당 없음첫 프레임만1720p/30fps예(fal.ai)예(MIT)
Seaweed APT2~5분해당 없음I2V + 포즈1720p아니요아니요
Helios분 단위해당 없음첫 프레임(I2V)1720pHF Spaces예(Apache 2.0)
SkyReels V3무제한해당 없음진정한 레퍼런스1-4720p아니요
Kling 3.015초~3분요소 + 스타일 레퍼런스71080p아니요
Grok Imagine15초연쇄 가능진정한 레퍼런스7720p아니요
Seedance 2.015초해당 없음멀티모달 레퍼런스122K아니요
Seedance 2.530초여러 라운드 확장멀티모달 레퍼런스502K예(BytePlus, Runway)아니요
Vidu Q316초해당 없음진정한 레퍼런스71080p아니요
MiniMax H315초해당 없음멀티모달 레퍼런스122K예(커뮤니티 라이선스)
Runway Gen-4.510초~1분I2V(0-1)11080p아니요
Veo 3.18초~2.5분구성 요소(스타일)34K아니요
Gemini Omni Flash10초대화형 편집 + 확장(1.1)멀티모달 레퍼런스이미지 + 영상720p예(GA)아니요
Sora 2 Pro ⚠️ 서비스 종료 예정20초연쇄 가능캐릭터 ID(영상)21080pAPI 2026년 9월 종료아니요
Hailuo 0210초해당 없음I2V(첫 프레임)11080p아니요
Luma Ray3.220초해당 없음키프레임 + 캐릭터 레퍼런스키프레임 16개1080p(4K 업스케일)아니요
Pika 2.510초25초Pikascenes101080p아니요
Wan 2.1 / 2.2짧은 클립연속 생성을 통해 확장I2V / FLF2V1-2720pfal.ai를 통해 제공예(Apache 2.0)
Wan 3.030초해당 없음멀티모달 레퍼런스이미지, 영상, 오디오1080p예(Alibaba Cloud)아니요
HunyuanVideo짧은 클립연속 생성을 통해 확장I2V(첫 프레임)1720pfal.ai를 통해 제공
LTX-2.320초연속 생성을 통해 확장I2V + 키프레임다중 키프레임4K예(LTX, fal.ai)가중치(ARR 제한)
CogVideoX6-10초연속 생성을 통해 확장I2V(첫 프레임)1720x480fal.ai를 통해 제공

앞으로 나올 기술

2026년까지의 발전 방향은 분명합니다. LongCat Video는 오픈 모델에서도 일관성을 유지한 분 단위 생성이 가능하다는 것을 입증했습니다. Helios는 이를 실시간으로 구현할 수 있음을 보여주었습니다. Seaweed APT2는 상호작용형 장편 생성을 시연했습니다. 그리고 진정한 레퍼런스를 지원하는 모델(Kling, Grok, Seedance)은 임의의 장면에서도 캐릭터 정체성을 유지할 수 있음을 입증했습니다.

다음 단계는 이러한 기능을 결합하는 것입니다. 즉, 진정한 캐릭터 레퍼런스를 지원하는 기본 장편 생성입니다. 현재는 둘 중 하나를 선택해야 합니다. 레퍼런스 이미지의 캐릭터를 수십 번의 장면 전환 동안 유지하면서 5분짜리 영상을 생성할 수 있는 모델이 나오면, 클립을 연쇄하는 워크플로는 더 이상 필요하지 않게 됩니다. Seedance 2.5(기본 30초 클립, 최대 50개 레퍼런스 파일, 2026년 7월 31일 출시)와 Wan 3.0(멀티모달 레퍼런스로 30초짜리 원테이크 생성, 2026년 8월)은 그 방향으로 나아가는 첫 번째 실질적인 단계입니다.

2026년 9월 초 기준, 오디오를 포함한 Artificial Analysis 텍스트-투-비디오 아레나에서는 Google의 Gemini Omni Flash와 API 전용인 Alibaba의 Wan 3.0이 약 1,239 Elo로 공동 1위를 차지하고 있습니다. MiniMax H3 Max와 H3가 몇 점 차이로 그 뒤를 잇고, 이어서 Seedance 2.0, Wan 2.7, HappyHorse 모델들, Sand.ai의 MAGI-2 프리뷰, Kling 3.0 Pro가 상위 10위를 구성합니다. 순위표는 자주 바뀌므로 특정 시점의 순위를 고정된 서열이 아닌 스냅샷으로 보세요.

3D 스캐폴드 방식은 이와 나란히 발전하는 또 다른 경로를 제공합니다. V2V 모델의 구조 보존 능력과 사실성이 향상될수록 저충실도 3D 렌더를 개선해 전체 프로덕션에 활용하는 방식의 실용성도 높아집니다. Meta의 RealMaster는 이미 게임 엔진 출력에서 연구 수준의 시뮬레이션-투-리얼 변환을 달성했습니다. 이 기능이 레퍼런스 이미지 지원과 함께 프로덕션 API로 제공되면, 기본적인 3D 기술만 있는 사람도 길이에 관계없이 카메라, 스테이징, 캐릭터 배치를 완전히 제어하면서 사실적인 장편 영상을 제작할 수 있게 됩니다.

현재로서는 사용 사례에 따라 실용적인 선택이 달라집니다.

다중 캐릭터 레퍼런스에 가장 적합: Kling 3.0(분리된 요소 + 스타일 시스템으로 최대 7개 레퍼런스), Seedance 2.5(30초 테이크에 최대 50개 멀티모달 입력), 또는 Vidu Q3(클립 내 카메라 전환과 태그가 지정된 레퍼런스 7개).

레퍼런스-투-비디오용 최고의 API: Grok Imagine(깔끔한 API, 명시적인 레퍼런스 모드, 기존 모델 기준 초당 $0.05), Vidu Q3(@ 태그, 레퍼런스 7개), 또는 fal.ai를 통한 Kling.

여러 클립에서 캐릭터를 지속적으로 유지하는 데 가장 적합: Kling 3.0의 요소 레퍼런스 또는 SkyReels V3의 레퍼런스 앤드 익스텐드. Sora 2 Pro의 캐릭터 ID 시스템이 가장 깔끔한 방식이었지만 2026년에 서비스가 종료될 예정이므로, 이를 기반으로 새 작업을 시작하지 마세요.

최고의 오픈 소스: SkyReels V3(1~4개의 진정한 레퍼런스 이미지, 무제한 길이), MiniMax H3(레퍼런스 이미지 9개와 영상·오디오, 지역별 신청이 필요한 커뮤니티 라이선스), 또는 Helios(실시간, Apache 2.0).

순수 길이에 가장 적합: LongCat Video(~15분, 단 첫 프레임만 지원).

3D 렌더 개선에 가장 적합: Kling 3.0 V2V(캐릭터별 요소 레퍼런스, 1080p) 또는 Lucy Restyle 2(30분 입력, 초당 $0.01).


자주 묻는 질문

장편 영상에 가장 적합한 AI 영상 모델은 무엇인가요?

순수 길이만 보면 LongCat Video가 기본적으로 약 15분을 생성하지만 첫 프레임만 지원합니다. 일관된 캐릭터가 등장하는 장편 영상의 경우, 2026년 현재 실용적인 해답은 레퍼런스 앤드 익스텐드 워크플로입니다. 레퍼런스 지원이 강력한 모델(Kling 3.0, Runway Gen-4.5 또는 오픈 소스 SkyReels V3)로 클립을 생성한 다음 연결하는 방식입니다. 긴 영상을 생성하면서 캐릭터 정체성까지 완벽하게 유지하는 단일 모델은 없으므로, 대부분의 프로덕션 작업에서는 여러 방식을 결합합니다.

어떤 AI 영상 모델이 레퍼런스 이미지를 지원하나요?

상용 옵션 중에서는 Kling 3.0 Omni, Runway Gen-4.5, Seedance 2.0 및 2.5, Vidu Q3, MiniMax H3, Google Veo 3.1, Gemini Omni Flash가 모두 레퍼런스 이미지를 지원합니다. 오픈 소스 쪽에서는 SkyReels V2/V3, Wan 2.1 및 2.2, LTX-2.5, 공개된 MiniMax H3 가중치가 직접 실행할 수 있는 레퍼런스 입력을 지원합니다. 지원 품질에는 큰 차이가 있으므로 위 가이드에서는 이를 여러 티어로 나누었습니다.

AI로 장편 영상 전체에서 일관된 캐릭터를 생성할 수 있나요?

예. 하지만 한 번에 생성할 수는 없습니다. 신뢰할 수 있는 방법은 하나 이상의 레퍼런스 이미지로 캐릭터를 고정하고, 짧은 클립을 생성한 다음, 동일한 레퍼런스를 다시 입력하면서 확장하거나 이어 붙이는 것입니다. 여기서는 진정한 레퍼런스 지원, 즉 모델이 새로운 생성에서도 정체성을 유지하는 기능이 시작 프레임만 설정하는 첫 프레임 컨디셔닝보다 훨씬 중요합니다.

첫 프레임 지원과 진정한 레퍼런스 이미지 지원의 차이점은 무엇인가요?

첫 프레임 조건 지정은 이미지를 영상의 실제 첫 프레임으로 사용한 뒤, 영상이 진행되면서 점차 원본에서 벗어나는 방식입니다. 진정한 레퍼런스 지원은 이미지를 모델이 생성 과정 내내 유지하는 정체성 기준점으로 활용하므로, 캐릭터나 스타일이 영상 전체는 물론 서로 다른 영상 사이에서도 일관되게 유지됩니다. 위 섹션에서는 어떤 모델이 어떤 방식을 지원하는지 자세히 설명합니다.

Kling AI의 다중 레퍼런스 이미지를 활용한 이미지 투 비디오는 어떻게 작동하나요?

Kling의 다중 이미지 레퍼런스는 일반적인 이미지 투 비디오와 별개의 모드입니다. 사진 한 장을 첫 프레임으로 애니메이션화하는 대신, 최대 7개의 이미지와 요소(레퍼런스 영상도 첨부하면 4개)를 업로드하고 프롬프트에서 @Image1 또는 @Element1로 태그한 다음 장면을 설명합니다. 요소는 최대 4장의 각도별 사진이나 짧은 영상 클립으로 만든 고정 캐릭터 또는 오브젝트이며, 선택적으로 음성을 연결할 수 있고 Kling의 멀티샷 스토리보드 전반에 걸쳐 유지됩니다. 전체 규칙은 위 Kling 섹션에 Kuaishou의 공식 가이드를 바탕으로 정리되어 있습니다.

Wan 2.2는 어떤가요? Wan 2.5 또는 Wan 3.0은 오픈 소스인가요?

Wan 2.2(2025년 7월)는 다운로드할 수 있는 최신 Wan으로, Apache 2.0 라이선스로 공개된 Mixture-of-Experts 모델입니다. RTX 4090 한 장에서 실행되는 5B 버전과 14B 텍스트 투 비디오 및 이미지 투 비디오 모델을 제공합니다. 제휴 블로그의 주장과 달리 Wan 2.5, 2.6, 2.7 및 Wan 3.0(2026년 8월, 최대 1080p의 30초 원테이크)은 Alibaba Cloud를 통해서만 API로 제공되며 공개 가중치는 없습니다. 공개 가중치로 레퍼런스 이미지 워크플로를 사용하려면 Wan 2.2의 이미지 투 비디오 및 첫·마지막 프레임 모델을 사용하거나 SkyReels V3와 MiniMax H3를 살펴보세요.

이미지 투 비디오와 레퍼런스 투 비디오의 차이는 무엇인가요?

이미지 투 비디오는 제공한 사진을 애니메이션화합니다. 이미지가 첫 프레임이 되고 모델이 그다음 장면을 이어서 생성합니다. 레퍼런스 투 비디오는 이미지를 정체성과 스타일의 기준점으로 사용하고 프롬프트에 따라 새로운 장면을 생성하므로, 스튜디오에서 촬영한 캐릭터가 숲속을 걷는 모습으로 등장할 수 있습니다. 완성된 정지 이미지를 움직이게 만들려면 이미지 투 비디오가 적합합니다. 일관된 캐릭터가 등장하는 여러 장면의 이야기를 만들려면 레퍼런스 투 비디오가 적합합니다. Kling, Vidu Q3, Seedance, Grok Imagine 및 MiniMax H3는 두 모드를 모두 제공하며, Vidu와 Grok은 API에서 각 모드를 명확히 구분해 표시합니다.

여러 영상에서 동일한 피사체를 유지하는 AI 영상 모델은 무엇인가요(피사체 레퍼런스)?

여러 영상에 걸쳐 피사체나 캐릭터를 참조하려는 경우, 2026년 9월 기준 가장 강력한 선택지는 Kling 3.0 Omni(다각도 사진과 음성을 지원하는 요소 라이브러리), Seedance 2.5(최대 50개 레퍼런스와 30초 분량), Vidu Q3(태그가 지정된 피사체 7개), MiniMax H3(레퍼런스 이미지 9개와 영상 및 오디오)입니다. Luma Ray3에는 캐릭터 레퍼런스 기능이 추가되었고 Sora 2 Pro의 캐릭터 ID는 가장 깔끔한 시스템이었지만, Sora의 API는 2026년 9월 24일에 종료됩니다. 공개 가중치 모델 중 진정한 피사체 레퍼런스를 지원하는 것은 SkyReels V3와 MiniMax H3입니다.


관련 자료

지금 바로 해보세요렌더링하는 대신 직접 플레이할 수 있는 장면을 만드세요

렌더링 대기열을 건너뛰고 장면 속을 실시간으로 달려보세요.

무료로 만들기 →무료입니다. 설치 없이 브라우저에서 바로 실행됩니다.