腾讯视频智能创作团队,开源了组合指令视频编辑数据集 CoinVE-200K。该数据集包含 20 万组视频编辑样本对,每个视频均为 1080p 分辨率,最长可达 201 帧。每个样本包含 2 至 5 个原子编辑操作,涵盖多个目标主体,包括人物、物体和背景,并覆盖广泛的编辑类型,包括添加、移除、修改以及风格化。

团队同时开源了基于 Wan2.1-T2V-14B 与 Qwen3-VL-8B-Instruct 构建的 22B 组合指令视频编辑模型 CoinVE-Edit,一次性在同一视频上完成多种编辑任务。

更进一步针对组合指令编辑任务,提出 CoinVE-Bech 评测集,包含 361 个测试样本,分别从编辑准确性、物理自然度、语义一致性和编辑视频质量等四个维度对视频编辑模型性能进行准确深度评估。

 

 

 

开源地址

数据集链接:
https://modelscope.cn/datasets/SandFox/CoinVE-200K

模型链接:
https://www.modelscope.cn/models/SandFox/CoinVE-Edit

评测集链接:
https://www.modelscope.cn/datasets/SandFox/CoinVE-Bench

代码仓库:
https://github.com/coinve200k/CoinVE-200K

 

行业背景

当前视频编辑领域基本都围绕单指令视频编辑范式展开,对于组合指令视频编辑没有进行系统和深入的研究。行业当前面对此类问题,主要有着三个痛点:

  1. 现有指令式视频编辑数据集大多聚焦于单一指令编辑操作,且普遍存在分辨率较低、视频帧数较少、编辑质量有限等问题,缺乏支撑组合式视频编辑训练的高质量数据。
  2. 组合指令视频编辑要求模型联合理解多条编辑指令,准确识别各指令对应的时空编辑区域,精确执行不同编辑操作,并在多处修改的同时保持无关内容不被破坏。
  3. 当前主流视频编辑 Benchmark 主要面向单一编辑任务或整体质量评估,缺乏针对多指令、多区域、多操作组合编辑能力的系统性评测。

 

CoinVE-200K组合指令视频编辑数据集

针对第一个问题,团队提出了一个高质量组合指令视频编辑数据集 CoinVE-200K。该数据集包含 20 万 视频编辑对,每个视频分辨率为 1080p,最高编辑帧数达 201 帧。每个编辑对包含 2 到 5 个原子编辑指令,涵盖了包括人物、物体、背景等多个目标物体,以及添加、移除、修改、风格化等不同编辑类型。相比同类开源数据集(如 ReCo-Data、OpenVE-3M 等),CoinVE-200K 在分辨率(1080p)、最大帧数(201)与平均指令数(2.55)三项指标上均更高。

 

 

 

同时,CoinVE-200K 的构建依托于一套数据生产与过滤流程。给定源视频后,团队首先分析其视觉内容,并识别其中可编辑的主体,包括前景人物、显著物体以及背景区域。随后,基于预定义的编辑分类体系,通过组合多个原子编辑操作来生成组合式编辑指令。这些指令进一步用于生成编辑后的视频,同时保持空间合理性与时间连贯性。为确保数据质量,团队采用了二次质量过滤策略,从多个维度评估生成的视频编辑样本对,包括指令遵循度、视觉质量、时间一致性和未编辑区域一致性。

 

CoinVE-Edit组合指令视频编辑模型

针对第二个痛点,团队更进一步提出了 CoinVE-Edit,一个基于 Wan2.1-T2V-14B 和 Qwen3-VL-8B-Instruct 构建的 22B 组合式视频编辑模型。CoinVE-Edit 针对不同编辑指令解耦了区域感知注意力机制,使模型能够实现精准的多区域编辑,同时保留无关内容并维持视频的时间一致性。其主要创新点包括三个方面:

  1. 引入基于 Qwen 的多模态大模型,同时处理源视频内容和多条文本编辑指令,提取面向组合式编辑的高层语义表示,使模型能够联合理解多个编辑意图,而非逐条、孤立地执行单一编辑。
  2. 设计 Feature Connector,将 MLLM 输出的隐藏特征转换为编辑感知 Tokens,包括与指令相关的可学习 Tokens 和视觉 Tokens。其中,指令相关 Tokens 作为视频生成过程中的语义条件,帮助 DiT 主干网络更准确地执行不同类型的编辑操作。
  3. 通过 Mask-based Conditioning 预测时空编辑区域 Mask,并生成不同控制信号,用于控制不同指令 Tokens 与视觉 Tokens 在 DiT 中的交互方式。该机制使模型能够将不同编辑指令精准绑定到对应的视频区域,实现多意图、多区域编辑,同时尽量保留无关内容并维持时间一致性。

 

 

CoinVE-Bench评测集

最后,针对评测困难的问题,团队借鉴了多个图片和视频编辑的评测方案,构建了评估组合指令视频编辑的 CoinVE-Bench。评测集包含了 361 个高质量源视频,每个测试样例包含编辑指令数为 2 到 5 个,围绕六种原子编辑操作构建,包括:添加物体、删除物体、替换物体、替换背景、局部物体风格化以及局部背景风格化。

整体评测包括两个大的互补维度,基于 MLLM 的 Checklist 评测和基于专用评估器的评测。前者主要关注指令引导视频编辑中的组合正确性,包含三个维度:编辑准确性、物理自然度和语义保持度。后者主要从视频质量维度衡量编辑结果的感知保真度,包括美学质量、技术质量、综合质量和时间稳定性。这两类评测方法覆盖了 4 个核心维度和 11 个细粒度指标,为评估编辑视频在组合式指令遵循正确性和视觉质量保真度两个方面的表现提供了统一框架。

 

 

 

组合编辑性能对比

下方表格展示了 CoinVE-Edit 模型在组合指令编辑评测集 CoinVE-Bench 上的性能比较。可看到,CoinVE-Edit 在 11 个细粒度指标上有 6 个指标超过了当前的闭源视频编辑模型 Seedance 2.0 和 Kling O3。特别是在编辑准确性(Edit. Acc)这个大维度,CoinVE-Edit 在指令遵循(SA)、编辑范围准确性(SPA)和编辑持续性(EP)均超过了闭源模型,体现了模型在复杂组合指令理解、局部区域精准编辑以及跨帧一致编辑保持方面的优势。

 

 

 

下图具体展示了三个组合指令视频编辑对比结果。从中可以看出,相比其他模型,CoinVE-Edit 普遍够更精准地理解并执行多条编辑指令,在仅修改目标区域的同时,有效保持非编辑区域的一致性,并展现出更好的物理合理性。以第一个 case 为例,其他模型在执行编辑时存在明显不足:对于“移除碗中的黄色玉米粒”这一指令,Seedance 2.0 和 Kling O3 都未能成功将其从碗中去除,其中 Kling O3 只是改变了玉米粒的颜色,而没有真正完成移除操作。

同时,多条指令之间还可能发生混淆,导致 Kling O3 错误地移除了右上角的紫色玻璃杯。相比之下,CoinVE-Edit 能够逐条精确遵循编辑要求,只对需要编辑的内容进行修改,并保持其他区域不变。此外,在物理合理性方面,CoinVE-Edit 也更稳定:例如 Seedance 2.0 会在碗中引入意外倒出的“红豆”,而 CoinVE-Edit 则避免了从空碗中倒出任何不必要的内容。

 

 

 

数据集下载与使用

CoinVE-200K 共 20 万组编辑样本、约 118 万个视频文件,总大小约 2.8 TB,以 tar 分片形式发布,包含源视频(src_videos/)、编辑后视频(tgt_videos/)、合并掩码(combined_masks/)、单指令掩码(instruction_masks/)和元数据文件 metadata_coinve200k.jsonl。

全量下载

modelscope download --dataset SandFox/CoinVE-200K --local-dir ./CoinVE-200K

按需下载(推荐先拉元数据试跑)

# 只下载元数据
modelscope download --dataset SandFox/CoinVE-200K \
  metadata_coinve200k.jsonl --local-dir ./CoinVE-200K

# 按分片下载源视频
modelscope download --dataset SandFox/CoinVE-200K \
  src_videos/src_video_000.tar src_videos/src_video_001.tar \
  --local-dir ./CoinVE-200K

解压 tar 分片

cd CoinVE-200K
for tar in src_videos/*.tar;        do tar -xf "$tar" -C src_videos/; done
for tar in tgt_videos/*.tar;        do tar -xf "$tar" -C tgt_videos/; done
for tar in combined_masks/*.tar;    do tar -xf "$tar" -C combined_masks/; done
for tar in instruction_masks/*.tar; do tar -xf "$tar" -C instruction_masks/; done

加载元数据

import json

with open("CoinVE-200K/metadata_coinve200k.jsonl", "r") as f:
    samples = [json.loads(line) for line in f]

print(f"Total samples: {len(samples)}")
print(f"First sample instructions: {samples[0]['instruction']}")

每条 JSON 记录包含源视频路径、编辑后视频路径、2–5 条编辑指令 instruction、对应的操作类型 instruction_operation(Replace / Add / Remove / Background Change 等)、目标类型 instruction_object(subject / object / background)、每条指令的空间掩码视频 instruction_mask_video_paths,以及聚合掩码 combined_mask_video_path,可直接用于监督组合指令编辑训练。

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐