过去几个月,实时视频世界模型突然成为一张拥挤的牌桌。PixVerse、LingBot、阿里「快乐生蚝」、智象未来等团队先后发布实时视频世界模型 Demo,并不约而同地将第一站指向互动娱乐/AI 游戏——当视频能够持续生成、实时响应,人就不再只是观看一段内容,而是可以“进入”一个由模型生成的世界。
 

在这个拥挤的牌桌上,Loopit 带来了一个值得注意的突破:其发布的实时互动世界模型 Zing-0.5,在美团 LongCat 与复旦大学联合推出的可交互视频世界模型评测 WBench 中拿到了第一名。模型已在魔搭社区开源,并计划 2 周内在 Loopit APP(海外版)上线对应产品功能。

 

Loopit 此前以「可以玩的抖音」被外界熟知,产品上线后曾获马斯克点赞,两个月登顶欧美娱乐榜,累计融资 1 亿美元。这家擅长做 C 端产品和全球增长的应用公司,反过来做出了自己的实时互动世界模型并在公开评测中夺冠。“模型吃掉应用”的故事,似乎被反了过来。
 

 

 

Zing-0.5 基于 5B 参数量级,基座为 Wan2.2-TI2V-5B,采用 Apache 2.0 协议开源。

模型下载地址:

  • ModelScope:https://modelscope.cn/models/seedleap/Zing-0.5

  • Github:https://github.com/seedleap/zing-world-model
     

 

 

联合控制:空间操作 + 语义改写

Zing-0.5 的核心能力被 Loopit 概括为「联合控制」——空间操作决定用户去哪里,语义输入决定世界发生什么,两种控制共同作用于同一段持续生成,新指令进入当前世界而不是替换当前世界。
 

围绕这条控制链路,以下五个 Case 展示了模型的逐层能力:
 

Case 1:飞行不中断,巨龙开始喷火

骑龙飞行约 43 秒后输入「龙嘴巴喷火」,火焰与烟雾随即出现,但巨龙仍沿原方向飞行,洞穴、瀑布和远处光源没有被重置。喷火结束后飞行继续,前后仍是一段完整的世界演化。

 

 

骑龙飞行43秒后输入「龙嘴巴喷火」

Case 2:一句指令同时改变人物和多座雕像

在石像场景第 14 秒输入「祈祷:主控人物跪地祈祷,所有人脸雕像睁开眼睛」。人物随即跪地,雕像睁眼并发光。这要求模型不仅理解「发生什么」,还要区分「谁发生变化」以及「哪些对象同时变化」。

 

 

主控人物祈祷,多座雕像同时睁眼

Case 3:连续改写——暴风雪之后,远方人像睁眼

从相同初始画面、相同操作轨迹和相同 Prompt 出发,对比 Zing-0.5 与同类模型:第 4 秒输入「暴风雪」改变全局天气,第 22 秒输入「远方人像睁眼」改变局部对象。难点在于第二条指令必须发生在已被暴风雪改变的世界中,而不是重新生成场景。Zing-0.5 能更稳定地把新指令写入当前世界。

 

 

相同起点下的「暴风雪—远方人像睁眼」连续改写对比,左侧为Zing-0.5,右侧为另一开源模型

Case 4:持续前进,角色与通道保持一致

连续生成的难点不只是多生成几秒,而是不要越走越偏。从相同画面出发持续前进时,Zing-0.5 中老鼠的耳朵、体型和黄色背包基本保持稳定,同类模型则逐渐出现角色颜色、比例和形态变化。

 

 

同起点、同操作下的持续前进对比,左侧为Zing-0.5,右侧为另一开源模型

Case 5:加入一朵蘑菇,不能顺手换掉整个世界

在像素风格游戏世界中,第 7 秒输入「一个蘑菇出现在前方」。Zing-0.5 延续了原有像素风格,角色、道路和远处建筑仍属于同一个世界。响应 Prompt 和保持一致性是两种不同的能力——实时生成不仅要知道增加什么,也要知道什么不该改变。

 

 

像素世界中途生成蘑菇,左侧为Zing-0.5,右侧为另一开源模型

 

技术架构:新指令如何进入正在运行的世界

五个 Case 测试的其实是同一个问题:新指令能否进入当前世界,而不是替换当前世界。为此,Zing-0.5 设计了两条独立、但共同进入 Causal DiT 的控制链路。
 

 

移动、转向和视角变化等连续信号经过 sin/cos 编码与因果时序卷积,形成逐帧 action residual 并与对应视频 token 对齐。文本条件改变时,动作链路仍然连续运行,因此巨龙能一边飞行一边喷火,人物也能一边移动一边观察环境变化。
 

训练时,Zing-0.5 会在自回归生成中途切换 Prompt:保留已生成的视觉历史和操作历史,用新的文本条件预测后续内容。「中途改写」不是在线推理时额外拼接的功能,而是模型从训练阶段就开始学习的能力。action residual 让世界继续运动,cross-attention 把新指令写入当前生成;两者共同决定接下来发生什么。
 

 

抗误差累积:接住自己的错误

很多视频世界模型最开始的几秒足够惊艳,但角色持续移动、反复转动视角并加入新事件后,误差会逐渐累积。因为模型后面看到的「历史」不再是真实视频,而是自己刚刚生成的结果。
 

Zing-0.5 的解法是在训练中主动扰动部分历史画面(加入噪声、轻微模糊、颜色偏移和视角变化),模拟连续生成中的误差,而训练目标始终保持干净正确。模型需要从不完美的历史中判断哪些是世界真正的状态、哪些只是生成偏差,并预测出更稳定的未来。这套方法主要发生在训练阶段,不需要在线增加额外的纠错模型。

 

04

 

本地部署

Zing-0.5 支持单卡部署。以下是基于官方仓库的本地运行方式。
 

环境要求:Linux、NVIDIA GPU(建议 80GB+ 显存;低于 80GB 可使用滑窗注意力配置)、Python 3.11、PyTorch 2.9。

安装步骤

# 克隆仓库

git clone https://github.com/seedleap/zing-world-model.git

cd zing-world-model



# 安装依赖

pip install -r requirements.txt

 

下载模型权重(从魔搭社区下载):

pip install modelscope

modelscope download --model seedleap/Zing-0.5 --local_dir ./Zing-0.5

 

模型目录结构如下:

Zing-0.5/

├── generator/

│ └── model.pt

└── pretrained/

    ├── text_encoder/

    ├── tokenizer/

    └── vae/

 

运行推理:

# 基础运行(Action T2V,文本驱动 + 键盘操作控制)

CUDA_VISIBLE_DEVICES=0 \

ZING_PYTHON=/path/to/python \

bash run.sh \

  --pretrained-dir ./Zing-0.5/pretrained \

  --checkpoint ./Zing-0.5/generator/model.pt \

  --messages examples/case3_action_t2v.jsonl \

  --output-dir outputs/case3 \

  --seed 0

 

图片初始化模式(Action TI2V):

CUDA_VISIBLE_DEVICES=0 \
ZING_PYTHON=/path/to/python \
bash run.sh \
  --pretrained-dir ./Zing-0.5/pretrained \
  --checkpoint ./Zing-0.5/generator/model.pt \
  --messages examples/case4_action_ti2v.jsonl \
  --output-dir outputs/case4 \
  --seed 0

 

显存配置说明:

GPU 显存

推荐参数

80GB+(如 H100/A100)

--local-attn-size 97 --sink-size 9

低于 80GB(如 RTX 4090)

--local-attn-size 33 --sink-size 5

完整历史注意力

--local-attn-size -1 --sink-size 0

输出为 H.264 编码的 MP4 文件,帧率 24 FPS。键盘操作通过 W/A/S/D(移动)+ I/J/K/L(视角)8 维向量控制,取值范围 [0, 1]。

 

 

 

 

 

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐