Zing-0.5:Loopit开源实时互动世界模型,WBench 评测第一,单卡 24 FPS、一分钟推理仅 6 分钱
过去几个月,实时视频世界模型突然成为一张拥挤的牌桌。PixVerse、LingBot、阿里「快乐生蚝」、智象未来等团队先后发布实时视频世界模型 Demo,并不约而同地将第一站指向互动娱乐/AI 游戏——当视频能够持续生成、实时响应,人就不再只是观看一段内容,而是可以“进入”一个由模型生成的世界。
在这个拥挤的牌桌上,Loopit 带来了一个值得注意的突破:其发布的实时互动世界模型 Zing-0.5,在美团 LongCat 与复旦大学联合推出的可交互视频世界模型评测 WBench 中拿到了第一名。模型已在魔搭社区开源,并计划 2 周内在 Loopit APP(海外版)上线对应产品功能。

Loopit 此前以「可以玩的抖音」被外界熟知,产品上线后曾获马斯克点赞,两个月登顶欧美娱乐榜,累计融资 1 亿美元。这家擅长做 C 端产品和全球增长的应用公司,反过来做出了自己的实时互动世界模型并在公开评测中夺冠。“模型吃掉应用”的故事,似乎被反了过来。


Zing-0.5 基于 5B 参数量级,基座为 Wan2.2-TI2V-5B,采用 Apache 2.0 协议开源。
模型下载地址:
-
ModelScope:https://modelscope.cn/models/seedleap/Zing-0.5
-
Github:https://github.com/seedleap/zing-world-model
联合控制:空间操作 + 语义改写
Zing-0.5 的核心能力被 Loopit 概括为「联合控制」——空间操作决定用户去哪里,语义输入决定世界发生什么,两种控制共同作用于同一段持续生成,新指令进入当前世界而不是替换当前世界。
围绕这条控制链路,以下五个 Case 展示了模型的逐层能力:
Case 1:飞行不中断,巨龙开始喷火
骑龙飞行约 43 秒后输入「龙嘴巴喷火」,火焰与烟雾随即出现,但巨龙仍沿原方向飞行,洞穴、瀑布和远处光源没有被重置。喷火结束后飞行继续,前后仍是一段完整的世界演化。

骑龙飞行43秒后输入「龙嘴巴喷火」
Case 2:一句指令同时改变人物和多座雕像
在石像场景第 14 秒输入「祈祷:主控人物跪地祈祷,所有人脸雕像睁开眼睛」。人物随即跪地,雕像睁眼并发光。这要求模型不仅理解「发生什么」,还要区分「谁发生变化」以及「哪些对象同时变化」。

主控人物祈祷,多座雕像同时睁眼
Case 3:连续改写——暴风雪之后,远方人像睁眼
从相同初始画面、相同操作轨迹和相同 Prompt 出发,对比 Zing-0.5 与同类模型:第 4 秒输入「暴风雪」改变全局天气,第 22 秒输入「远方人像睁眼」改变局部对象。难点在于第二条指令必须发生在已被暴风雪改变的世界中,而不是重新生成场景。Zing-0.5 能更稳定地把新指令写入当前世界。

相同起点下的「暴风雪—远方人像睁眼」连续改写对比,左侧为Zing-0.5,右侧为另一开源模型
Case 4:持续前进,角色与通道保持一致
连续生成的难点不只是多生成几秒,而是不要越走越偏。从相同画面出发持续前进时,Zing-0.5 中老鼠的耳朵、体型和黄色背包基本保持稳定,同类模型则逐渐出现角色颜色、比例和形态变化。

同起点、同操作下的持续前进对比,左侧为Zing-0.5,右侧为另一开源模型
Case 5:加入一朵蘑菇,不能顺手换掉整个世界
在像素风格游戏世界中,第 7 秒输入「一个蘑菇出现在前方」。Zing-0.5 延续了原有像素风格,角色、道路和远处建筑仍属于同一个世界。响应 Prompt 和保持一致性是两种不同的能力——实时生成不仅要知道增加什么,也要知道什么不该改变。

像素世界中途生成蘑菇,左侧为Zing-0.5,右侧为另一开源模型
技术架构:新指令如何进入正在运行的世界
五个 Case 测试的其实是同一个问题:新指令能否进入当前世界,而不是替换当前世界。为此,Zing-0.5 设计了两条独立、但共同进入 Causal DiT 的控制链路。

移动、转向和视角变化等连续信号经过 sin/cos 编码与因果时序卷积,形成逐帧 action residual 并与对应视频 token 对齐。文本条件改变时,动作链路仍然连续运行,因此巨龙能一边飞行一边喷火,人物也能一边移动一边观察环境变化。
训练时,Zing-0.5 会在自回归生成中途切换 Prompt:保留已生成的视觉历史和操作历史,用新的文本条件预测后续内容。「中途改写」不是在线推理时额外拼接的功能,而是模型从训练阶段就开始学习的能力。action residual 让世界继续运动,cross-attention 把新指令写入当前生成;两者共同决定接下来发生什么。
抗误差累积:接住自己的错误
很多视频世界模型最开始的几秒足够惊艳,但角色持续移动、反复转动视角并加入新事件后,误差会逐渐累积。因为模型后面看到的「历史」不再是真实视频,而是自己刚刚生成的结果。
Zing-0.5 的解法是在训练中主动扰动部分历史画面(加入噪声、轻微模糊、颜色偏移和视角变化),模拟连续生成中的误差,而训练目标始终保持干净正确。模型需要从不完美的历史中判断哪些是世界真正的状态、哪些只是生成偏差,并预测出更稳定的未来。这套方法主要发生在训练阶段,不需要在线增加额外的纠错模型。

04
本地部署
Zing-0.5 支持单卡部署。以下是基于官方仓库的本地运行方式。
环境要求:Linux、NVIDIA GPU(建议 80GB+ 显存;低于 80GB 可使用滑窗注意力配置)、Python 3.11、PyTorch 2.9。
安装步骤
# 克隆仓库
git clone https://github.com/seedleap/zing-world-model.git
cd zing-world-model
# 安装依赖
pip install -r requirements.txt
下载模型权重(从魔搭社区下载):
pip install modelscope
modelscope download --model seedleap/Zing-0.5 --local_dir ./Zing-0.5
模型目录结构如下:
Zing-0.5/
├── generator/
│ └── model.pt
└── pretrained/
├── text_encoder/
├── tokenizer/
└── vae/
运行推理:
# 基础运行(Action T2V,文本驱动 + 键盘操作控制)
CUDA_VISIBLE_DEVICES=0 \
ZING_PYTHON=/path/to/python \
bash run.sh \
--pretrained-dir ./Zing-0.5/pretrained \
--checkpoint ./Zing-0.5/generator/model.pt \
--messages examples/case3_action_t2v.jsonl \
--output-dir outputs/case3 \
--seed 0
图片初始化模式(Action TI2V):
CUDA_VISIBLE_DEVICES=0 \
ZING_PYTHON=/path/to/python \
bash run.sh \
--pretrained-dir ./Zing-0.5/pretrained \
--checkpoint ./Zing-0.5/generator/model.pt \
--messages examples/case4_action_ti2v.jsonl \
--output-dir outputs/case4 \
--seed 0
显存配置说明:
|
GPU 显存 |
推荐参数 |
|---|---|
|
80GB+(如 H100/A100) |
--local-attn-size 97 --sink-size 9 |
|
低于 80GB(如 RTX 4090) |
--local-attn-size 33 --sink-size 5 |
|
完整历史注意力 |
--local-attn-size -1 --sink-size 0 |
输出为 H.264 编码的 MP4 文件,帧率 24 FPS。键盘操作通过 W/A/S/D(移动)+ I/J/K/L(视角)8 维向量控制,取值范围 [0, 1]。
更多推荐




所有评论(0)