近日,上海人工智能实验室(上海AI实验室)推出决策模型书生·明决(Decision),性能超越Jev及同类开源模型,包含0.8B、2B、4B三档参数版本。

 

智能体在动态环境执行任务时,决策的速度与精度,直接决定交互的质量与任务落地的效果。书生·明决将原生视觉感知与指令遵循融为一体——在“看见”画面的同时做出精准决断。实测显示:

 

  • 单卡4090环境中决策速度达30次/秒:书生·明决0.8B和2B模型延迟约33毫秒,4B模型单次端到端时延为44.16毫秒,比Jev快2倍以上。

 

  • 7项测评登顶SOTA:在JevBench等7项基准评测中,书生·明决4B模型平均得分达到90.02,居参评模型榜首。

 

此外,结合置信度分流机制,书生·明决还可将不确定的问题交由大模型处理,探索兼顾响应速度与决策准确性的协作模式。

 

2024年,上海人工智能实验室主任、首席科学家周伯文提出:真正的通用人工智能(AGI)需要构建一种能够动态融合“系统1”(直觉式快思考)与“系统2”(逻辑式慢思考)的智能架构——“智者”SAGE。书生·明决作为系统1的代表成果,与承担系统2的大模型将形成有机快慢协同。

 

书生·明决即将接入书生·端砚科学发现平台,为科学智能场景下的实验交互与自动化科研闭环注入新动能。

 

 

 

构建多模态决策能力,实现复杂场景即时决策

结构化决策将模型的判断转化为程序可直接使用的选项。Jev等模型虽已探索这一方向,但游戏和多模态决策等交互场景还要求模型读懂图像、识别界面变化。书生·明决在此基础上,把视觉信息融入决策环节,实现决策选择和画面感知相结合。团队通过游戏、图形界面等操作演示,验证了书生·明决的多模态决策能力。

在真实游戏场景里,书生·明决能直接读取游戏画面,自主选择下一步动作。测试用到的游戏画面类型丰富,包括二维网格地图、横版闯关场景,以及第一人称三维场景,需要模型完成路线选择、识别危险物品、判断空间方位等任务。团队观察到,在部分场景下,AI角色撞到墙壁后,会主动转动视角,寻找新目标。

动图封面

 

书生·明决读取游戏画面并选择动作

在图案验证码演示中,书生·明决可以独立完成读懂指令、识别图案目标、输出点击动作整套操作。全换成自主完成,无需人工介入修正,直观展现了它结合视觉识别、自主选择操作的交互能力。

动图封面

 

书生·明决根据视觉指令完成鼠标交互

兼顾决策速度与效果,综合表现超Jev

团队围绕JevBench的Easy、Original、Hard三个子集,以及Typed Decision、ToolACE、AG News和WildJailBreak共七项任务开展对比评测。书生·明决4B模型的平均得分为90.02,较Jev的88.74高出1.28分,在本次参评模型中居首位。

其中,4B模型在Typed Decision和ToolACE上的得分分别为80.55和96.45,高于Jev的73.35和91.29;在JevBench-Hard上取得73.87,与JevK5并列最高。各模型在单项任务上各有优劣,4B模型在本次评测中展现出更均衡、领先的综合性能。

 

 

七项任务平均得分及概率质量指标

在RTX 4090上的推理速度测试中,书生·明决0.8B和2B模型的平均端到端时延分别为33.98毫秒和33.28毫秒,对应每秒约30次决策;4B模型的平均时延为44.16毫秒,P95时延为44.60毫秒。相比之下,Jev平均时延为109.70毫秒。更低的时延意味着更快的响应速度,为智能体不间断环境感知、动作选择与任务执行提供保障。

 

 

RTX 4090测试环境下的端到端推理时延

 

 

探索快慢思考协同机制,求取决策效率与质量最优解

在真实交互场景中,任务难度参差不齐。智能体除输出决策结果外,还需给出判断依据:选择的可信程度如何,以及哪些问题值得进一步核验。为此,科研团队对书生·明决进行温度校准,提升模型置信度与客观现实的一致性。

在JevBench-Hard的可靠性分析中,校准前模型在高置信度区域存在偏差,部分接近0.9或1.0的置信度并未对应同等水平的准确率。校准后,这一偏差有所减小,为后续根据置信度进行任务分流提供了依据。对比Jev的置信度表现,书生·明决的校准效果更优。

 

 

JevBench-Hard上的可靠性曲线 对角线表示置信度与准确率一致

团队还构建了选项概率分布评测集,覆盖直接随机性、混合分布、条件概率、观测偏差、概率谜题和序列过程六类场景,并为每道题提供精确的参考分布。测试显示,经过校准优化后,书生·明决的概率预测误差明显下降,关键指标均优于Jev。以经典“三门问题”举例:按照理论,最开始选中的门中奖概率约33%,剩下那扇没打开的门中奖概率约67%。校准之后,书生·明决给出的判断概率为42%和58%,对比Jev给出的18%和82%,书生·明决的结果更贴近真实理论值。

模型输出的置信度,恰好可以作为分工依据,实现不同模型之间的任务调度。轻量小模型快速处理大量常规判断;当模型判断结果存疑时,再将任务移交大模型进行深度推理分析。

团队基于JevBench-Hard的111道题,验证了这一协作机制。书生·明决4B模型独立作答,答对82题(准确率73.87%),耗时4.90秒。Atria-Dawn-Preview独立作答,能答对99道(准确率89.19%),但耗时增加至300.03秒。

书生·明决按照置信度判断,挑出42道拿不准的题目交给Atria-Dawn-Preview来处理。这种大小模型搭配的组合方案一共答对97道(准确率87.39%),整套任务耗时约140.16秒,比全程用大模型少答对2道题,但花费的时间减少约53.3%。

这一结果证明了在响应速度与准确率之间进行按需分配的可能:对时延敏感的环节可优先使用小模型,需要进一步提高准确率时,则依据置信度引入大模型。具体分流策略可随任务需求调整。

 

 

不同决策方案的准确率与总耗时对比

除了将小模型低置信度问题抛给大模型之外,书生·明决也可以作为大模型的执行部件完成复杂任务。在浏览器操作中,大模型负责理解整体目标、拆解阶段任务并整合跨页面信息;书生·明决负责高频局部决策,根据当前页面从点击、滚动、返回和结束等候选动作中作出选择。每次操作后,系统重新读取页面状态,继续下一轮判断,最终通过大小模型的协作交互完成复杂指令。

动图封面

 

 

书生·明决在Hugging Face中查找书生·星河模型并核对架构与推理配置

书生·明决在多场景下展现出图像感知、自主决策的智能交互特性,大小模型按需分流的调度机制,为平衡性能与效率提供可行路径。相关探索能够支撑科学智能领域的实验交互与仿真迭代,为构建自动化科研闭环积累实践参考。接下来,团队将继续围绕通专融合路线,进一步打通通用感知能力与领域科学任务,推动智能体在复杂科研场景下落地应用。

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐