Viggle AI 开源 Meridian:MiniMax-H3 + VGGT-Ω 几何引导,单图生成新视角的视频
Viggle AI 开源几何引导视频模型 Meridian。该模型基于 MiniMax-H3,并通过 VGGT-Ω 从输入视频中提取深度、摄像机位姿等几何信息,可分别控制观察视角、摄像机路径与时间节奏。用户可以从已有视频或单张图像出发,对已发生的事件重新设计镜头,例如生成环绕运镜、变换观察角度,或在暂停、慢放过程中移动摄像机。Meridian 支持在单张 B200 GPU上完成推理。

- 模型下载:
https://modelscope.cn/models/Viggle/Meridian - 项目介绍:
https://viggle.ai/research/meridian-a-new-perspective-on-space-and-time
效果案例
同一事件,重新选择观看方式
Meridian 的官方演示围绕一个问题展开:事件已经被记录下来之后,是否还可以重新决定从哪里看、以什么速度看,以及在哪个瞬间停留。
摩托车越野:组合摄像机路径

芭蕾照片:从单张图像生成镜头运动

NBA 扣篮:生成视角与原始片段衔接

浆果落水:播放、暂停与继续

技术解读
分别控制空间和时间
Meridian 将镜头的空间变化和事件的时间变化拆开处理。空间维度包括环绕、推近或拉远、横向移动、上下移动,以及视线方向和视场角;时间维度包括选择片段、停留在某一帧,以及在生成前对输入视频进行慢放或快放。两者可以组合为:围绕一个暂停的瞬间移动摄像机,跟随慢动作过程,或为加速后的片段选择新的观察角度。
因此,Bullet Time 只是空间控制和时间控制的一种组合,并不是模型能力的边界。需要改变动作速度时,应先对输入视频进行重新定时,再在新的时间轴上设计摄像机路径。
从几何参考到最终视频

Meridian 的处理过程可以分为三步:
- 构建几何信息。 VGGT-Ω 从输入视频估计深度和摄像机位姿,并将选定帧转换为带颜色的三维点。
- 渲染新的观察视图。 对每个输出帧指定输入视频中的时间位置和摄像机视角,渲染对应的三维点;原始画面没有覆盖到的区域会以灰色区域表示。
- 生成完整镜头。 Meridian 同时接收原始视频和匹配的几何渲染视频,补全未覆盖区域并细化最终画面。
可以简单理解为:几何先把新角度的画面“搭”成一张带空洞的草稿,视频模型再把草稿补成成片。
模型下载与推理
Meridian 可以使用一张 B200 GPU进行推理,在服务常驻和默认适配器配置下,可以参考以下数据:
| 输出长度 | 镜头生成时间 | 峰值显存 |
| 73帧 | 约36秒 | 88GiB |
| 124帧 | 约80秒 | 89GiB |
| 243帧 | 约150秒 | 113GiB |
模型与代码下载
pip install -U modelscope
modelscope download \
--model Viggle/Meridian \
--local_dir ./Meridian
安装依赖
cd Meridian
python -m pip install -r requirements.txt
python -m pip install peft==0.18.0
快速推理
运行脚本:
# 对连续事件生成轻微的 15° 环绕镜头
python inference/sample.py \
--video examples/media/sp_bouldering_hang.mp4 \
--yaw 15 --sweep --ease --out out/orbit
# 播放 24 帧,保持第 24 帧 49 个输出帧,同时移动摄像机
python inference/sample.py \
--video examples/media/sp_bouldering_reach.mp4 \
--yaw 35 --freeze 24:49 --out out/bullet
打开 out/orbit/grid.mp4 可对比 源视频 → 几何参考 → 生成片段。其中,生成片段为 out.mp4;render.mp4 是带有灰色空洞的几何输入。
更多推荐




所有评论(0)