推理成本降低96%,保持高精度:PyroDash 用一次交接重新定义 AI 推理
当数百B参数的大模型全速轰鸣,只为了处理一个极其简单的步骤时——昂贵的算力就像一个拧不紧的水龙头,大部分资源在无意义的低效消耗中白白流走。
奥特曼预测,全球人均月Token消耗将从今天的约10万飙升至5000亿,推理需求每年增长十倍。与此同时,成本正在击穿企业——有公司一个季度花光全年AI预算,微软被迫削减AI工具权限...当AI进入Agent、复杂推理和企业生产环境,高频调用和长链路任务让"始终使用最强模型"越来越难成为系统最优解。
在 Pyromind 看来,解法不是使用更大的单一模型,而是让多个模型协同工作——根据任务状态,在不同模型、算力和成本之间动态分配能力。
近期,团队提出的PyroDash,从用户的账单成本为视角切入,通过大小模型协同推理的范式,为这个问题提供了一个全新的解法。它的核心创新在于两点:推理过程中的动态协同——小模型在生成过程中自主判断何时请求大模型,而不是在请求开始前就做出决定;以及基于账单成本的reward函数设计,,让推理系统可以在效果与成本之间实现更灵活的平衡。
从单模型推理到模型协同
大模型擅长复杂推理,但高频使用的成本难以接受;小模型成本更低,却很难稳定覆盖高难度任务。业界常见的解法是对模型进行路由。常见的query级的模型路由,会在生成前判断难度,再把整个请求交给小模型或大模型。但一个现实情况是真实任务的难度在实际执行过程中才能展现又会在执行中变化:开头可能只是信息分析提取,中途才进入复杂判断,最后才进行答案编写。
在高频、长链路任务中,所有步骤都交给大模型,成本会持续放大;请求开始时就交给小模型,又可能无法应对中途出现的难点。因此,推理系统真正需要解决的问题,正在从“这道题应该交给哪个模型”,变成“任务进行到哪一步时,应该调用哪一层能力”。
常见的query级路由,会在生成前判断难度,再把整个请求交给小模型或大模型。它能减少使用成本,但必然引入性能损失,因为现实情况是,真实任务的难度难以静态预测,在实际执行过程中才能展现:开头可能只是信息分析提取,中途才进入复杂判断,最后才进行答案编写。
更细粒度的方法是在模型生成的每个token或推理步骤之间决策是否切换模型,但这需要额外路由模型,反复切换会引入传输和计算的延迟,导致性能下降。难以被实际用户接受。
因此,面向现有商用 API 和企业模型服务条件的协同推理,需要同时回答三个问题:
- 小模型的引入,是否会影响实际任务上的表现。
- 在保持任务表现不变的情况下,小模型究竟能节省多少成本。
- 能否把准确率收益和真实推理成本放进同一个优化目标。
PyroDash:让小模型在生成过程中决定是否交接
Pyromind 提出的 PyroDash:一种以 token 为粒度、成本感知的大小模型协同推理范式。
整套系统由三个部分组成:负责默认推理的小模型、保持冻结的大模型,以及执行模型交接的协同引擎(Collaborate Engine)。

图 1|PyroDash 协同推理架构
它遵循一条相对克制的原则:小模型优先,但最多只进行一次从小模型到大模型的交接。
一个请求进入系统后,会经过五个步骤:
- 协同引擎先把问题交给小模型;
- 小模型以流式方式开始生成,并持续返回 token;
- 如果小模型能够独立完成,系统直接返回结果,全程不调用大模型;如果需要更强能力,小模型则输出专属控制 token τoff;
- 协同引擎检测到信号后,停止小模型生成,打包原始问题和此前形成的部分推理轨迹;
- 系统调用一次冻结的大模型,让它沿着已有轨迹继续推理并完成答案,控制权不再返回小模型。
由于大模型始终保持冻结,PyroDash 不需要微调大模型,也不需要访问它的内部概率信息,只需要标准文本续写接口。这使它原则上可以兼容闭源大模型 API 或企业已有的大模型服务。
PyroDash 的真实效果:在准确率与成本之间拉出新空间
这套看似克制的单次交接机制,实际能带来多大变化?一句话总结:PyroDash不仅比GLM更便宜,在高精度模式下甚至比GLM更准确。
在实验中,PyroDash 使用 Qwen3.5-4B 与 GLM-5.2-FP8 组成大小模型协同系统,并在 GSM8K、Minerva、OlympiadBench、AIME24 和 AIME25 五项数学推理测试上进行评估。五项平均准确率采用等权计算。

图 2|五项数学推理测试中的总成本与平均准确率
准确率优先:64.04%,超过纯大模型
在高精度模式下,PyroDash 平均准确率达到 64.04%,比纯大模型 GLM-5.2-FP8 的 57.68% 高出 6.36 个百分点。同时,五个 benchmark 上的估算总成本相比纯大模型降低 20.4%。这一提升来自小模型前缀与大模型续写之间的协作,形成了更好的准确率—成本折中。
在高难度竞赛题上,提升也比较明显:AIME24 从纯大模型的 46.56% 提升到 63.75%,AIME25 从 40.62% 提升到 48.75%。
成本优先:从 49.36 美元降到 1.78 美元
在低成本模式下,PyroDash 平均准确率为 54.55%,高于 RouteLLM 的 52.74% 和 GlimpRouter 的 54.20%。同时,LLM 生成 token 占比仅 1.90%,平均每个样本调用大模型 0.012 次,约等于每 100 个样本调用 1.2 次大模型。
在论文评估的价格模型下,五个 benchmark 上的估算总成本从纯大模型的 49.36 美元降至 1.78 美元,成本下降 96.4%。
横向对比:更低的大模型 token 占比
RouteLLM 和 GlimpRouter 的大模型输出 token 占比分别为 77.37% 和 75.11%,均超过 75%;而 PyroDash 在低成本模式下,大模型输出 token 占比只有 1.90%。这一结果表明,PyroDash 在显著降低大模型 token 占比的同时,仍保持了高于两类路由基线的平均准确率,并将估算成本降到了更低水平。
对于要长期、高频调用大模型的Agent场景来说,这意味着一条更省钱也更可持续的路径。
这些结果如何实现:让模型学会何时交接
核心技术点,是让小模型形成一种可训练的协同策略:既识别什么时候自己能够完成,也判断调用大模型带来的准确率收益是否值得相应成本。
为此,PyroDash 采用了三阶段训练。

图 3|PyroDash 三阶段渐进式训练流程
阶段一:让小模型学会表达“需要交接”
原始小模型的词表中不存在 τoff。第一阶段先加入这个专属控制 token,并训练其输入和输出表示,使小模型能够稳定识别和生成交接信号。
这一阶段解决的是“能不能表达交接”,还没有决定什么时候应该交接。
阶段二:用 SFT(监督微调)建立两种基本行为
第二阶段负责行为冷启动。
PyroDash 使用包含 24,061 个样本的 EasyHard-24K 数据集,根据当前小模型能否正确完成任务,将样本划分为 easy 和 hard:easy 样本用于学习独立完成,hard 样本用于学习在协同模式下请求帮助。
hard 样本不能直接使用小模型原有的错误推理,否则会把错误路径重新训练进模型。为此,数据构建过程会使用LLM构造能够导向正确结果的CoT,并在轨迹中插入候选交接位置。
SFT 由此让小模型先学会两种基本模式:简单任务继续完成,困难任务允许发出交接信号。但这些候选位置只是行为起点,还不是成本和准确率意义上的最优决策位置。
阶段三:用 GRPO 优化准确率与成本的取舍
第三阶段进一步使用成本感知的 GRPO(群组相对策略优化,一种强化学习方法),让小模型在完整协同推理中学习何时交接。
奖励同时考虑答案是否正确,以及当前协同推理相对于“完全使用大模型”的成本。成本不仅包括小模型生成,还包括交接后大模型接收已有轨迹的上下文输入成本,以及继续生成答案的成本。
其中,λ 是控制准确率与成本偏好的权重:
- λ 较小时,系统更愿意调用大模型换取准确率;
- λ 较大时,系统更强调减少大模型使用和推理成本。
经过这一阶段,小模型学习的不再是固定题型或人工阈值,而是一项成本感知的交接策略。模型协同策略可以通过后训练学出来。
从 PyroDash 看 AI 推理的未来
通过后训练,小模型的角色开始从低成本执行者走向协同推理的主动决策者:它既承担默认推理,也判断何时继续、何时请求更强能力。大模型则从默认入口转为关键节点的能力补充。PyroDash 展示的,是一条根据任务状态动态分配模型能力、同时兼顾效果与成本的协同推理路径。模型之间何时交接,也可以作为一项策略通过后训练获得。这也构成了 Pyromind 对 AI 推理未来的一项判断:
下一阶段的推理竞争,不只是让单个模型变得更大,更重要的是让整个推理系统更高效。
消费级显卡、本地的空闲算力虽然无法支撑TB级别的大模型推理,但是可以支撑小模型推理,作为重要补充。
小模型能进行偏好学习、隐私处理,覆盖更广的垂直场景,减轻大模型负载。在这样的新范式下,大小模型不再是互斥关系,而是协同进化。
PyroDash指向的更远方向,是一个由异构模型构成的共生网络——算力和智能按需流动,而非固定在一组权重中。这为更普惠、更可持续的协同智能提供了一条具体路径。而随着落地场景的逐步扩展,后训练也将自然延伸并演进为Agent的持续学习。
当然,PyroDash 目前仍有明确边界。
论文实验集中在数学推理,单次生成上限为 8,192 tokens,更长输出下的表现尚未验证;当前模型组合限于 Qwen3.5-4B 与 GLM-5.2-FP8,更多模型组合仍有待测试;成本依据公开 token 价格估算,而非实际服务账单,团队计划进一步提供面向 Code 和 Agent 场景的模型与评估,方便开发者复现和使用。
最新进展:
Agentic-Preview:团队使用 SFT + OPD + GRPO 完成了初步训练,训练数据集与场景正在扩增中。结果显示,在 SWE-Bench Verified 上可在节省约 20% 成本的同时仅降低约 5% 精度;更多训练与实验正在进行中。预计在 1 个月后发布相应的稳定版本。
团队计划进一步提供面向 Code 和 Agent 场景的模型与评估,方便开发者复现和使用。
附录 · OPEN SOURCE
PyroDash 的模型、数据集、论文、测试代码均已开源:
PyroDash 的全链路训练实验均在 Pyromind 平台完成(平台目前已上线):
— 项目网站:https://pyromind-dynamics.github.io/pyroDash/
— 模型:https://modelscope.cn/models/Pyromind/PyroDash-4B-GRPO-Lambda-0.05
— 数据集:https://modelscope.cn/datasets/Pyromind/easyhard-24k
— 技术报告:https://modelscope.cn/papers/2607.20327
— 开源代码:https://github.com/PyroMind-Dynamics/pyroDash
更多推荐




所有评论(0)