在阿里云 GPU 服务器上部署 Wan 2.2:24G 显存就能跑的开源文生视频模型

阿里通义万相 Wan 2.2 是目前性价比最高的开源文生/图生视频模型,TI2V-5B 单卡 24G 就能跑 720P。本文记录在阿里云 GPU 实例上从零部署的完整过程,包含实例选型、环境安装、模型下载、推理命令与常见坑。

阅读时长: 4 分钟
共 1595字
作者: eimoon.com

阿里通义实验室开源的 Wan 2.2 是目前部署门槛最低的高质量文生视频模型之一。其中 TI2V-5B 单卡 24G 显存就能跑 720P @ 24fps,相比腾讯 HunyuanVideo 动辄 80G 的需求友好太多。本文记录在阿里云 GPU 服务器上从零部署的完整过程。

同样想跑 HunyuanVideo 的读者可以看上一篇:在阿里云 GPU 服务器上部署腾讯混元 HunyuanVideo

一、模型版本选择

Wan 2.2 一共有三个版本,先选对再开机:

版本 参数量 类型 分辨率 显存建议
TI2V-5B 5B 文生视频 + 图生视频 720P @ 24fps 24GB ✅ 入门
T2V-A14B 14B MoE 文生视频 480P / 720P 80GB
I2V-A14B 14B MoE 图生视频 480P / 720P 80GB

先用 TI2V-5B 跑通,效果不满意再上 14B。本文以 TI2V-5B 为主。

二、阿里云实例选型

按 TI2V-5B 推荐:

  • ecs.gn7i(A10,24G)✅ 性价比最高,按量约 5–8 元/小时
  • 自建 4090 / 4090D(24G)✅ 本地有卡的话最划算
  • ecs.gn7e / ebmgn7ex(A100 80G)✅ 想跑 14B 选这个

系统:Ubuntu 22.04 / 20.04 CUDA:12.1+(PyTorch 2.4 要求) 磁盘:≥ 100GB(5B 权重约 20GB,14B 约 60GB)

调试阶段强烈建议用抢占式实例,价格通常是按量的 1/3 到 1/5。

三、基础环境

sudo apt update && sudo apt install -y \
  git git-lfs wget curl build-essential
git lfs install
nvidia-smi

如果 nvidia-smi 报错,先到阿里云控制台用带 GPU 驱动的镜像,或装 NVIDIA 官方驱动。

四、安装 Miniconda

wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh
bash Miniconda3-latest-Linux-x86_64.sh -b -p $HOME/miniconda3
source $HOME/miniconda3/bin/activate
conda init bash && exec bash

五、克隆仓库

git clone https://github.com/Wan-Video/Wan2.2.git
cd Wan2.2

六、创建 Conda 环境

conda create -n wan22 python=3.10 -y
conda activate wan22

七、安装 PyTorch 与项目依赖

国内服务器先把 pip 源换成阿里云镜像:

pip config set global.index-url \
  https://mirrors.aliyun.com/pypi/simple/

安装 PyTorch(CUDA 12.4,要求 ≥ 2.4.0):

pip install \
  torch==2.4.0 torchvision==0.19.0 torchaudio==2.4.0 \
  --index-url https://download.pytorch.org/whl/cu124

安装项目依赖:

pip install -r requirements.txt

Wan 2.2 不强制要求 Flash Attention 3。FA3 仅在 H100/H800 这类 Hopper 架构上自动启用,A10/4090 跑普通 attention 也能正常出图。

八、下载模型权重

国内强烈推荐用 ModelScope,速度比 HuggingFace 镜像还稳:

pip install modelscope
modelscope download Wan-AI/Wan2.2-TI2V-5B \
  --local_dir ./Wan2.2-TI2V-5B

也可以走 HuggingFace 镜像:

export HF_ENDPOINT=https://hf-mirror.com
pip install -U "huggingface_hub[cli]"
huggingface-cli download Wan-AI/Wan2.2-TI2V-5B \
  --local-dir ./Wan2.2-TI2V-5B

5B 模型大约 20GB,A10 实例的 1.5–3 Gbps 带宽下几分钟就能拉完。

九、首次推理:文生视频

24G 显存(A10 / 4090)跑 720P:

python generate.py \
  --task ti2v-5B \
  --size 1280*704 \
  --ckpt_dir ./Wan2.2-TI2V-5B \
  --offload_model True \
  --convert_model_dtype \
  --t5_cpu \
  --prompt "夜晚的东京街头,霓虹灯倒映在湿润的柏油路上,一只黑猫从巷子里慢慢走出,电影感运镜"

关键参数解释:

  • --offload_model True:模型分块卸载到 CPU,省显存
  • --convert_model_dtype:把权重转低精度
  • --t5_cpu:T5 文本编码器放 CPU 跑(节约 5G+ 显存)

如果是 80G A100,把上面三个参数全去掉,速度会快不少:

python generate.py \
  --task ti2v-5B \
  --size 1280*704 \
  --ckpt_dir ./Wan2.2-TI2V-5B \
  --prompt "夜晚的东京街头,霓虹灯倒映在湿润的柏油路上,一只黑猫从巷子里慢慢走出,电影感运镜"

性能参考:单张消费级 GPU 出 5 秒 720P 视频约 9 分钟。

十、图生视频

--image 参数即可切到 I2V 模式:

python generate.py \
  --task ti2v-5B \
  --size 1280*704 \
  --ckpt_dir ./Wan2.2-TI2V-5B \
  --offload_model True \
  --convert_model_dtype \
  --t5_cpu \
  --image ./my_photo.jpg \
  --prompt "镜头缓慢推进,主角微笑回头,背景光斑虚化"

十一、多卡并行(可选)

8 卡 FSDP + Ulysses,跑大批量或 14B 时用:

torchrun --nproc_per_node=8 generate.py \
  --task ti2v-5B \
  --size 1280*704 \
  --ckpt_dir ./Wan2.2-TI2V-5B \
  --dit_fsdp \
  --t5_fsdp \
  --ulysses_size 8 \
  --prompt "你的提示词"

十二、常见坑

  • OOM:24G 卡必须带 --offload_model True --convert_model_dtype --t5_cpu 三件套,少一个都可能爆。
  • torch 版本太低:Wan 2.2 要求 ≥ 2.4.0,仓库里默认 requirements 不一定固定版本,最好按本文方式先装 2.4.0 再装其他依赖。
  • 首次推理特别慢:第一次会编译 kernel、加载权重,第二次开始才是正常速度。别看到 9 分钟以为卡死。
  • 中文 prompt 效果差:Wan 2.2 中文支持比 Hunyuan 好,但精细镜头描述用英文仍更稳,可中英混写。
  • ModelScope 下载断开modelscope download 自带断点续传,断了直接重跑同一条命令即可。

十三、Wan 2.2 vs HunyuanVideo:怎么选

简单结论:

  • 入门 / 调试 prompt:Wan 2.2 TI2V-5B(24G 卡就能跑)
  • 想要更好的中文理解和稳定运镜:Wan 2.2 14B(80G)
  • 追求极限画质和复杂镜头语言:HunyuanVideo(80G+,环境更复杂)

我自己的工作流是先在 A10 24G 上用 5B 反复迭代 prompt,确认方向后再上 80G 跑高质量版本。这样能把成本压到最低。

关于

关注我获取更多资讯

月球基地博客公众号二维码,扫码关注获取更多 AI 与编程资讯
📢 公众号
月球基地博客作者个人微信二维码,扫码交流 AI 与编程话题
💬 个人号
使用 Hugo 构建
主题 StackJimmy 设计