개요
Kandinsky 5.0은 Flow Matching이 적용된 잠재 확산 파이프라인을 사용하며 다음과 같은 특징이 있습니다:- Diffusion Transformer (DiT): 텍스트 임베딩에 대한 크로스 어텐션을 갖춘 주요 생성 백본
- Qwen2.5-VL 및 CLIP: 고품질 텍스트 임베딩 제공
- HunyuanVideo 3D VAE: 비디오를 잠재 공간으로 인코딩 및 디코딩
- SFT 모델: 최고의 생성 품질
- CFG-distilled: 2배 빠른 추론
- Diffusion-distilled: 최소한의 품질 손실로 6배 빠름 (16스텝)
- Pretrain 모델: 파인튜닝용으로 설계
모델 변형
텍스트 기반 비디오 생성 워크플로우
Kandinsky 5.0 Video Lite 텍스트 기반 비디오 생성
영어와 러시아어 프롬프트로 높은 시각적 품질의 비디오를 생성하는 경량 2B 모델입니다.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로우 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “Kandinsky 5.0 Video Lite Text to Video” 검색
2. 모델 수동 다운로드
텍스트 인코더Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors
Qwen2.5-VL 7B 텍스트 인코더 (FP8).
ComfyUI/models/text_encoders/에 배치Text Encoder: clip_l.safetensors
CLIP-L 텍스트 인코더.
ComfyUI/models/text_encoders/에 배치Diffusion Model: kandinsky5lite_t2v_sft_5s.safetensors
Kandinsky 5.0 T2V Lite SFT diffusion 모델 (5s).
ComfyUI/models/diffusion_models/에 배치VAE: hunyuan_video_vae_bf16.safetensors
HunyuanVideo 3D VAE.
ComfyUI/models/vae/에 배치이미지 기반 비디오 생성 워크플로우
Kandinsky 5.0 Video Lite 이미지 기반 비디오 생성
영어와 러시아어 프롬프트로 높은 시각적 품질의 비디오를 생성하는 경량 2B 모델입니다.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로우 다운로드
JSON을 다운로드하거나 템플릿 라이브러리에서 “Kandinsky 5.0 Video Lite Image to Video” 검색
LoadImage 노드에 업로드하세요:
crystal_flower.png
LoadImage 노드 11 · crystal_flower.png
2. 모델 수동 다운로드
텍스트 인코더Text Encoder: qwen_2.5_vl_7b_fp8_scaled.safetensors
Qwen2.5-VL 7B 텍스트 인코더 (FP8).
ComfyUI/models/text_encoders/에 배치Text Encoder: clip_l.safetensors
CLIP-L 텍스트 인코더.
ComfyUI/models/text_encoders/에 배치Diffusion Model: kandinsky5lite_i2v_5s.safetensors
Kandinsky 5.0 I2V Lite diffusion 모델 (5s).
ComfyUI/models/diffusion_models/에 배치VAE: hunyuan_video_vae_bf16.safetensors
HunyuanVideo 3D VAE.
ComfyUI/models/vae/에 배치