概述
Wan2.1 是由通义万相(Wan-AI)开源的一套视频基础模型,旨在推动视频生成领域的普惠化研究与应用。Wan2.1 在多个基准测试中均达到了业界领先(SOTA)的性能,并支持消费级 GPU 运行。
Wan2.1 的主要特点:
- SOTA 性能:Wan2.1 在多个公开基准(如 Wan-Bench、VBench 等)以及内部评测中均取得领先成绩,在文生视频(Text-to-Video)、图生视频(Image-to-Video)、视频编辑等任务上均超过现有开源模型与多数商业方案。
- 消费级 GPU 支持:Wan2.1 的 1.3B 模型仅需 8.19GB 显存即可运行,绝大多数消费级 GPU 均可流畅推理。14B 模型在 RTX 4090 等单卡上也可完成 480P 视频生成。
- 多任务统一:Wan2.1 同时支持文生视频、图生视频、视频编辑、文本生图像、文生音频、视频生音频、图像生视频等任务,使用统一架构与训练范式。
- 强大的视频生成能力:基于大规模优质数据训练,Wan2.1 在运动、时序、视觉质量、指令遵循等维度均有出色表现,并支持复杂运动、专业镜头语言、物理一致性以及中英文文字渲染。
- 中文文本生成能力:Wan2.1 是同时支持中英文文本与符号视频生成的开源视频基础模型,显著提升视频中文字生成的可读性与准确性。
模型列表
Wan2.1 包含以下开源模型:
| 能力 | 模型 | 分辨率 | 参数规模 |
|---|---|---|---|
| 文生视频(T2V) | Wan2.1-T2V-1.3B | 480P | 1.3B |
| 文生视频(T2V) | Wan2.1-T2V-14B | 480P / 720P | 14B |
| 图生视频(I2V) | Wan2.1-I2V-14B-480P | 480P | 14B |
| 图生视频(I2V) | Wan2.1-I2V-14B-720P | 720P | 14B |
| 视频编辑(VACE) | Wan2.1-VACE-1.3B | 480P | 1.3B |
| 视频编辑(VACE) | Wan2.1-VACE-14B | 480P / 720P | 14B |
| 文生图像(T2I) | Wan2.1-T2I-14B | — | 14B |
快速上手
环境准备
克隆仓库并安装依赖:
git clone https://github.com/Wan-Video/Wan2.1.git
cd Wan2.1
pip install -r requirements.txt
模型权重下载
可通过 Hugging Face 或 ModelScope 下载权重:
- Hugging Face:访问 Wan-AI 组织主页 下载所需模型。
- ModelScope:在 ModelScope 搜索
Wan-AI相关模型仓库。
推理示例(Diffusers)
import torch
from diffusers import WanPipeline
from diffusers.utils import export_to_video
pipe = WanPipeline.from_pretrained(
"Wan-AI/Wan2.1-I2V-14B-480P",
torch_dtype=torch.float16
).to("cuda")
prompt = "A cat walking gracefully on a wooden floor, cinematic lighting."
image = load_image("https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/diffusers/cat.png")
output = pipe(
image=image,
prompt=prompt,
num_frames=81,
guidance_scale=5.0,
num_inference_steps=50,
).frames[0]
export_to_video(output, "output.mp4", fps=16)
提示:1.3B 模型在 8GB 显存设备上即可推理;14B 模型建议使用 24GB 显存的消费级 GPU 或更高规格硬件。
性能基准
Wan2.1 在主流公开基准上均取得领先成绩。下方列出部分代表性结果(数据来自官方论文与项目主页):
- Wan-Bench:在 480P / 720P 分辨率下综合得分位居开源模型前列。
- VBench-1.0:文生视频与图生视频子任务均超过同类开源模型。
- VBench-2.0:在运动合理性、物理常识、时序一致性等维度表现突出。
- 人类主观评测:在视觉质量、指令遵循、动作自然度等方面优于主流闭源方案。
详细的指标对比与可视化样例可参考 Wan2.1 技术报告 与官方 GitHub 仓库。
引用
如果 Wan2.1 对你的研究或产品有帮助,请引用:
@article{wan2025,
title={Wan: Open and Advanced Large-Scale Video Generative Models},
author={Wan Team},
journal={arXiv preprint arXiv:2503.20314},
year={2025}
}
致谢与许可
- 模型与代码遵循 Apache 2.0 协议开源。
- 感谢开源社区在数据集、训练框架与评测工具方面的支持。
- 详细许可信息请参见各模型仓库的 LICENSE 文件。
相关链接
- 项目主页:https://github.com/Wan-Video/Wan2.1
- 技术报告:https://arxiv.org/abs/2503.20314
- Hugging Face 组织:https://huggingface.co/Wan-AI
- ModelScope 组织:https://www.modelscope.cn/Wan-AI