开源的风吹到视频生成:阿里开源登顶VBench的万相大模型:一手实测来了

时间:2026-07-21 08:28:59 来源:互联网

img_6a5ebd49ebc1b30.webp

视频展示万相模型精准遵循文本指令,成功生成包含多元种族互动的场景,多主体运动镜头保持稳定无崩坏,为后续探讨其物理建模与技术创新奠定基础。

万相模型还具备中英文双语言理解能力,能够准确处理不同语言的输入指令。

img_6a5ebd4a0937e31.webp

物理建模

学习物理规律是所有视频生成模型的共同目标,避免出现违背现实逻辑的“一眼AI”效果。万相模型在此方面展示了显著进步,通过大量视频数据训练,掌握了物体运动与交互的物理特性。

测试中,我们使用如下提示词:透明玻璃杯在桌面倾倒,牛奶缓慢流出,液体在桌面形成蜿蜒流动轨迹,微距镜头展现液体表面张力,写实风格。

模型成功还原了牛奶流到桌面后的动态痕迹,并考虑了牛奶的粘稠度。杯子的反光特性以及牛奶与杯子接触留下的液膜也得到精细呈现。

img_6a5ebd4a171db32.webp

在草莓入水视频中,模型出色展示了草莓与水之间复杂的相互作用力,水珠的透明感结合特写与微距摄影技巧,完整还原了草莓坠入水中的物理之美。

img_6a5ebd4a2132033.webp

提示词:一颗草莓坠入清澈透明的水中,草莓轻轻旋转下沉,特写镜头捕捉这一刻的动态美,微距摄影风格,强调水珠的透明感和草莓的鲜艳色泽。

除了下载开源模型,用户还可通过万相模型网页端直接体验新功能。

该网页端集成了文生视频、图生视频、首尾帧生成及视频配乐等多种功能。实际测试中,这些功能均表现良好,凸显其在广告、短视频等领域的应用潜力。

例如,上传一张图片并输入提示词:女生随着音乐跳舞。

img_6a5ebd4a2c6c634.webp

万相模型立即让静态画面动起来,主角的动作和表情更加丰富生动。

万相大模型核心技术创新

万相模型实现生成能力突破的关键在于两大核心创新:高效的因果3D VAE,以及视频Diffusion Transformer。

高效的因果3D VAE

研究团队自研了专为视频生成设计的新型因果3D VAE架构,结合多种策略优化时空压缩、降低内存使用并确保时间因果性。

img_6a5ebd4a3e46d35.webp

万相模型视频VAE架构示意图。

实验结果表明,万相视频VAE在各项指标上极具竞争力。在相同硬件环境(单个A800 GPU)下,其重建速度比现有最先进方法(如HunYuanVideo)快2.5倍。

视频Diffusion Transformer

万相模型架构基于主流视频DiT结构,通过Full Attention机制确保长时程时空依赖的有效建模,实现时空一致的视频生成。训练采用线性噪声轨迹的流匹配(Flow Matching)方法。

模型首先使用多语言umT5编码器对输入文本进行语义编码,并通过逐层交叉注意力层将文本特征注入每个Transformer Block的特征空间,实现细粒度语义对齐。同时,一组在所有Transformer Block中共享参数的MLP将输入时间步特征T映射为AdaLN层的可学习缩放与偏置参数。实验发现,共享时间步特征映射层参数在保持模型能力的同时显著降低参数和计算量。

此外,万相模型通过可扩展的预训练策略、大规模数据链路构建及自动化评估指标,共同提升了最终性能。

Qwen + 万相实现全模态开源

回顾2023年,开源模型能否追上闭源模型曾引发广泛讨论。在此背景下,顶级AI公司如Meta等纷纷走上开源路线。

如今,Qwen衍生模型已突破10万个,超越Meta的Llama系列,跻身全球最大AI模型家族之列。在Huggingface最新开源大模型榜单(OpenLLMLeaderboard)中,前十名全部由基于Qwen开发的衍生模型包揽,展现了中国开源模型的蓬勃生命力。

img_6a5ebd4b4b92d36.webp

Huggingface 2月10日官网榜单截图。

Qwen的开源模型不仅在语言方面表现出色,在多模态领域也处于领先地位:今年1月开源的视觉理解模型Qwen2.5-VL斩获OCRBenchV2、MMStar、MathVista等13项评测冠军,全面超越GPT-4o与Claude3.5,打破了“开源不如闭源”的固有认知。

img_6a5ebd4b5c35f37.webp

万相与Qwen两大基础模型现已全部开源,实现真正意义上的全模态开源,这在当前AI巨头中独树一帜。

目前,万相已登陆GitHub、HuggingFace和魔搭社区平台,全面对接主流框架。从Gradio快速体验到xDiT并行加速推理,再到即将接入的Diffusers和ComfyUI,模型为开发者提供了全方位支持,降低了技术门槛,满足不同场景需求。

万相模型的开源进一步丰富了视频生成领域,其多模态能力与生态支持为开发者提供了广阔前景,期待模型家族持续演进。