阿里通义实验室开源的 Wan 2.2 是目前部署门槛最低的高质量文生视频模型之一。其中 TI2V-5B 单卡 24G 显存就能跑 720P @ 24fps,相比腾讯 HunyuanVideo 动辄 80G 的需求友好太多。本文记录在阿里云 GPU 服务器上从零部署的完整过程。
同样想跑 HunyuanVideo 的读者可以看上一篇:在阿里云 GPU 服务器上部署腾讯混元 HunyuanVideo。
一、模型版本选择
Wan 2.2 一共有三个版本,先选对再开机:
| 版本 | 参数量 | 类型 | 分辨率 | 显存建议 |
|---|---|---|---|---|
| TI2V-5B | 5B | 文生视频 + 图生视频 | 720P @ 24fps | 24GB ✅ 入门 |
| T2V-A14B | 14B MoE | 文生视频 | 480P / 720P | 80GB |
| I2V-A14B | 14B MoE | 图生视频 | 480P / 720P | 80GB |
先用 TI2V-5B 跑通,效果不满意再上 14B。本文以 TI2V-5B 为主。
二、阿里云实例选型
按 TI2V-5B 推荐:
ecs.gn7i(A10,24G)✅ 性价比最高,按量约 5–8 元/小时- 自建 4090 / 4090D(24G)✅ 本地有卡的话最划算
ecs.gn7e/ebmgn7ex(A100 80G)✅ 想跑 14B 选这个
系统:Ubuntu 22.04 / 20.04 CUDA:12.1+(PyTorch 2.4 要求) 磁盘:≥ 100GB(5B 权重约 20GB,14B 约 60GB)
调试阶段强烈建议用抢占式实例,价格通常是按量的 1/3 到 1/5。
三、基础环境
sudo apt update && sudo apt install -y \
git git-lfs wget curl build-essential
git lfs install
nvidia-smi
如果 nvidia-smi 报错,先到阿里云控制台用带 GPU 驱动的镜像,或装 NVIDIA 官方驱动。
四、安装 Miniconda
wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh -b -p $HOME/miniconda3
source $HOME/miniconda3/bin/activate
conda init bash && exec bash
五、克隆仓库
git clone https://github.com/Wan-Video/Wan2.2.git
cd Wan2.2
六、创建 Conda 环境
conda create -n wan22 python=3.10 -y
conda activate wan22
七、安装 PyTorch 与项目依赖
国内服务器先把 pip 源换成阿里云镜像:
pip config set global.index-url \
https://mirrors.aliyun.com/pypi/simple/
安装 PyTorch(CUDA 12.4,要求 ≥ 2.4.0):
pip install \
torch==2.4.0 torchvision==0.19.0 torchaudio==2.4.0 \
--index-url https://download.pytorch.org/whl/cu124
安装项目依赖:
pip install -r requirements.txt
Wan 2.2 不强制要求 Flash Attention 3。FA3 仅在 H100/H800 这类 Hopper 架构上自动启用,A10/4090 跑普通 attention 也能正常出图。
八、下载模型权重
国内强烈推荐用 ModelScope,速度比 HuggingFace 镜像还稳:
pip install modelscope
modelscope download Wan-AI/Wan2.2-TI2V-5B \
--local_dir ./Wan2.2-TI2V-5B
也可以走 HuggingFace 镜像:
export HF_ENDPOINT=https://hf-mirror.com
pip install -U "huggingface_hub[cli]"
huggingface-cli download Wan-AI/Wan2.2-TI2V-5B \
--local-dir ./Wan2.2-TI2V-5B
5B 模型大约 20GB,A10 实例的 1.5–3 Gbps 带宽下几分钟就能拉完。
九、首次推理:文生视频
24G 显存(A10 / 4090)跑 720P:
python generate.py \
--task ti2v-5B \
--size 1280*704 \
--ckpt_dir ./Wan2.2-TI2V-5B \
--offload_model True \
--convert_model_dtype \
--t5_cpu \
--prompt "夜晚的东京街头,霓虹灯倒映在湿润的柏油路上,一只黑猫从巷子里慢慢走出,电影感运镜"
关键参数解释:
--offload_model True:模型分块卸载到 CPU,省显存--convert_model_dtype:把权重转低精度--t5_cpu:T5 文本编码器放 CPU 跑(节约 5G+ 显存)
如果是 80G A100,把上面三个参数全去掉,速度会快不少:
python generate.py \
--task ti2v-5B \
--size 1280*704 \
--ckpt_dir ./Wan2.2-TI2V-5B \
--prompt "夜晚的东京街头,霓虹灯倒映在湿润的柏油路上,一只黑猫从巷子里慢慢走出,电影感运镜"
性能参考:单张消费级 GPU 出 5 秒 720P 视频约 9 分钟。
十、图生视频
加 --image 参数即可切到 I2V 模式:
python generate.py \
--task ti2v-5B \
--size 1280*704 \
--ckpt_dir ./Wan2.2-TI2V-5B \
--offload_model True \
--convert_model_dtype \
--t5_cpu \
--image ./my_photo.jpg \
--prompt "镜头缓慢推进,主角微笑回头,背景光斑虚化"
十一、多卡并行(可选)
8 卡 FSDP + Ulysses,跑大批量或 14B 时用:
torchrun --nproc_per_node=8 generate.py \
--task ti2v-5B \
--size 1280*704 \
--ckpt_dir ./Wan2.2-TI2V-5B \
--dit_fsdp \
--t5_fsdp \
--ulysses_size 8 \
--prompt "你的提示词"
十二、常见坑
- OOM:24G 卡必须带
--offload_model True --convert_model_dtype --t5_cpu三件套,少一个都可能爆。 torch版本太低:Wan 2.2 要求 ≥ 2.4.0,仓库里默认 requirements 不一定固定版本,最好按本文方式先装 2.4.0 再装其他依赖。- 首次推理特别慢:第一次会编译 kernel、加载权重,第二次开始才是正常速度。别看到 9 分钟以为卡死。
- 中文 prompt 效果差:Wan 2.2 中文支持比 Hunyuan 好,但精细镜头描述用英文仍更稳,可中英混写。
- ModelScope 下载断开:
modelscope download自带断点续传,断了直接重跑同一条命令即可。
十三、Wan 2.2 vs HunyuanVideo:怎么选
简单结论:
- 入门 / 调试 prompt:Wan 2.2 TI2V-5B(24G 卡就能跑)
- 想要更好的中文理解和稳定运镜:Wan 2.2 14B(80G)
- 追求极限画质和复杂镜头语言:HunyuanVideo(80G+,环境更复杂)
我自己的工作流是先在 A10 24G 上用 5B 反复迭代 prompt,确认方向后再上 80G 跑高质量版本。这样能把成本压到最低。
关于
关注我获取更多资讯