北大清华阿里开源 SparkDiffusion:单卡 265 倍视频生成加速
北大清华阿里开源 SparkDiffusion:单卡 RTX 5090 将 720P-14B 视频生成提速 265 倍,VBench-2.0 降 0.5 点。

北大、清华、阿里、电子科大与哈工大的联合团队开源了 SparkDiffusion——据论文称是第一个把稀疏注意力、少步蒸馏与低精度量化组合进 DiT 视频生成的统一开源系统。在 RTX 5090 单卡、把 720P-14B 模型(Wan2.1/Wan2.2)推到 97% 稀疏度的最佳条件下,生成加速 265 倍:18 秒生成 5 秒视频,VBench-2.0 从 60.2 降到 59.77。论文、代码与权重全部开放。
事实部分
- 方法:RoLA 稀疏注意力(对照终端监督对齐)+ CrossDistill 轨迹级混合蒸馏(3 步、无 CFG 学生模型)+ FP8 量化。
- 加速数字(论文口径):RTX 5090 单卡 720P-14B 在 97% 稀疏度下 265 倍(18 秒生成 5 秒视频);90% 稀疏度为 201 倍;H100 为 220 倍(8 秒);480P-1.3B 为 140 倍。
- 质量代价:VBench-2.0 从 60.2 到 59.77(-0.5);论文承认 97% 稀疏度下质量「略有下降」。
- 核心发现:「高稀疏陷阱」——训练 loss 持续下降但极稀疏下生成质量坍塌,解法是把监督对齐到终端(RoLA + CrossDistill)。
- 开放情况:arXiv 2609.23153、代码 AlibabaResearch/SparkDiffusion、HF 权重均已发布;为未经同行评审的新预印本。
编辑判断
265 倍是最佳条件的上限数字,但即使按保守的 90% 稀疏度(201 倍),在消费级单卡上把 14B 视频模型从分钟级压进几十秒也是实打实的管线成本下降。给 Story-Flicks 这类图文转视频工具或自建视频管线的团队,值得在自己的模型与分辨率下重跑一组对照。注意基准是作者自己的测试框架,接入前先用自己的素材验质量。