当大模型逐渐掌握对话、推理、编程和工具调用之后,自主研究被视为下一个关键方向。

普通问答只需要定位一个事实,而自主研究面对的是一组相互关联、彼此制约的条件。智能体不仅要从庞大的信息空间中定位候选答案,还需整合分散甚至冲突的证据,并确认最终答案满足全部关键约束——只要有一项未验证,答案即为无效解。自主研究的核心难题并不是“搜索得还不够久或者证据难找”,而是:智能体能不能知道当前答案到底已经成立了什么、还缺什么,以及下一步最应该研究什么,是如何让智能体在复杂约束中持续接近正确答案

智源研究院发布的 AREX 正是围绕这一核心问题提出的。它抓住了自主研究中的关键突破口——“发现—验证不对称性”:完整答案往往难以一次性生成,但一旦形成候选解,便可以通过针对关键约束的逐项验证,快速定位不足并指导后续探索。验证的意义并非仅仅判断答案是否正确,更重要的是帮助智能体理解“已经知道什么、还缺少什么,以及下一步应该研究什么”,从而让每一轮研究都更加精准、更具方向性。

AREX 模型权重现已开放下载。

项目主页:

https://vectorspacelab.github.io/arex-model/

模型权重:

https://modelscope.cn/collections/BAAI/AREX

体验链接:

https://arex-research.com

 

AREX旨在训练能长期运行、自我验证、持续修正的研究型智能体

AREX的目标,不是让模型在单轮回答中写出一个“看起来更完整”的答案,而是训练一种能长期运行、持续验证、递归修正的自主研究智能体——不是一次性给出答案,而是在“研究→验证→再研究”的循环中不断接近完整解,让模型真正具备持续改进当前解的能力。

面对复杂任务,智能体可以先给出一个阶段性答案;随后,它会逐项检查约束是否满足,保留已经验证的证据,定位尚未解决的主张,再发起更有针对性的后续研究。

当新的证据到来后,智能体会再次更新答案、重新验证,并判断是继续深入,还是结束研究并输出最终结论。这一过程可以递归执行多轮:研究→ 暂定答案 → 逐项验证 → 定位缺口 → 定向研究 → 更新答案。这里的“自我改进”,并不是指模型在执行任务时在线更新参数,而是指智能体对自身研究状态和当前答案进行持续修正。

它不再只是一个“搜索后回答”的工具,而更像一个会反复检查研究进度、修正研究路径、沉淀有效证据的研究助手。

 

AREX通过双循环框架打通“找到答案”与“改进答案”的闭环

AREX的整体方法,可以概括为一套双循环递归求解框架。内层循环负责“研究”,外层循环负责“改进”。二者协同,让智能体不只是向前搜索,而是在每一轮中继承已有进展、修正错误方向,并不断接近更可靠的答案。

 

正在上传…重新上传取消

 

内层循环Research Loop:内层循环负责完成一轮相对完整的研究。在这一阶段,智能体会围绕当前研究问题搜索信息、调用工具、收集证据、比较候选,并构造一个暂定答案。它的目标不是一次性得到终局解,而是形成一个结构完整、证据可追踪、后续可以被审计的当前解。如果这是第一轮研究,智能体面对的是用户提出的原始问题。如果已经经过外层验证,那么它面对的就是一个被重新定义过、更聚焦的新问题。例如:补齐某项缺失证据,消解两个来源之间的矛盾,或者替换一个无法满足全部条件的候选答案。这意味着,每一轮研究都不是简单重复,而是在更清晰的问题上继续推进。

外层循环Self-Improvement Loop:外层循环负责判断当前答案究竟走到了哪一步。AREX会依据任务中的各项约束,对暂定答案进行逐项审计,并形成约束级别的置信判断:哪些条件已经获得充分支持,哪些仍然不确定,哪些关键主张缺少证据,哪些结论需要重新研究。如果所有必要条件都得到足够支持,智能体就结束研究并输出答案。如果仍有条件没有解决,验证结果就会被转化为下一轮内层循环的研究目标。因此,外层循环不是简单地说“答案还不够好,再试一次”,而是明确告诉内层循环:已经解决了什么,接下来只需要解决什么。这让每一轮递归都能继承已有成果,而不是从头开始。

 

机制分析:长程研究状态维护带来的性能提升

AREX的推理机制包含两个循环:内层研究循环负责搜索、访问网页、验证证据、更新上下文并生成暂定答案;外层自我改进循环根据答案、证据和置信度,决定接受、继续细化或重新开始。

其中,自主上下文更新(ACU)是关键。它不是普通摘要,而是面向下一步行动的研究状态:保留已验证发现、已排除候选、未解决约束和下一步计划。BrowseComp上的分析显示,AREX通常会主动更新上下文,而不是等到128K上下文窗口被塞满后才被动压缩。

受控实验显示,AREX完整系统在BrowseComp上达到82.5,比关闭ACU和外层循环的版本高出22.9个百分点。训练消融也表明,渐进式多轮能力训练、关键步骤聚焦监督和步骤感知强化学习分别贡献于工具交互、关键决策和长程策略优化。

 

正在上传…重新上传取消

 

 

正在上传…重新上传取消

 

训练消融进一步说明,AREX的提升来自多个环节共同作用。渐进式多轮能力训练先建立稳定的工具交互能力,关键步骤聚焦监督把训练信号集中到证据发现、路径否定与重定向、关键上下文更新等转折点,步骤感知强化学习则继续优化长程决策策略。

这也解释了AREX的核心思想:长程研究中真正难的不是例行搜索和访问网页,而是在关键时刻做对决定,什么时候相信一个证据,什么时候放弃一个候选,什么时候重整上下文并改变搜索方向,这些才是决定研究成败的步骤。

 

AREX让自主研究智能体在长程任务中持续自我进化

长程研究不“失忆”:将“历史包袱”转化为“进度路标”。长程研究中的核心挑战,并不只是信息检索是否充分,更在于模型能否在持续延展的研究过程中稳定记住当前进展。随着交互轨迹不断变长,历史记录中会同时包含已验证的证据、被推翻的假设、中途放弃的计划以及大量重复信息。全盘保留这些内容容易让模型迷失方向,而简单截断又可能丢掉关键线索。

AREX的做法,是让模型在研究过程中主动调用上下文更新工具,将不断增长的交互历史整理成一个可以继续推进的研究状态。这种更新并不是普通摘要,而是一份“研究进度表”,帮助模型明确:当前研究到哪了?什么已经成立?什么已经被排除?接下来最该查什么?通过这种方式,模型能够持续继承有效信息、压缩冗余内容,并在当前阶段形成更稳健的最优解。

构造可验证的训练数据:从确定答案出发,生成可验证的研究轨迹。自我改进不是靠延长搜索轨迹就能堆砌出来的。AREX 需要的是那种能真正教会模型如何发现线索、交叉验证、推翻错误候选、调整方向并继续前进的数据。

为此,AREX设计了一套可验证的自主研究任务生成方法:先从一个确定的实体答案出发,围绕它构造一组必须被真实证据支撑的约束条件,然后再把这些约束改写为无法通过关键词直接命中的开放式问题。这样生成的任务,迫使模型必须真正去搜索、比对和验证,而不是在文本表述里“找答案”。

随后,强教师模型在同样工具环境中完整执行这些任务,留下全过程的研究轨迹。但凡出现直接猜答案、忽略观察、证据不足或结论与证据矛盾等情况,整条轨迹都会被剔除。最终保留下来的,是从不确定候选逐步走向可验证答案的研究轨迹。

分阶段训练与关键步骤强化:使模型掌握自我改进的连贯策略。在获得高质量训练数据之后,训练顺序同样关键。AREX没有将所有轨迹简单混合训练,而是采取了分阶段策略。模型首先学习多轮工具调用和证据获取的基本能力,再逐步进阶到长链推理、候选比较和困难问题求解。同时,AREX还会巩固论文研究、高难知识推理等专项能力,避免不同任务之间的能力相互干扰。

AREX也不会把长轨迹中的每一步都同等对待。真正决定研究是否能够取得突破的,往往是少数关键转折点,例如找到关键证据、否定错误候选、切换搜索方向,以及更新研究状态。这些关键步骤会在训练中被重点关注,并在强化学习阶段继续优化模型的研究策略。

因此,AREX的自我改进能力并不是“多搜几轮”自然涌现的结果,而是由可验证任务设计、高质量轨迹筛选、分阶段训练和关键步骤强化共同塑造出来的。它的目标是让智能体更接近真正的研究者:能够判断何时坚持当前方向,何时及时掉头,何时停下来确认答案。

 

实验评估:AREX以10B激活参数达到自主研究前沿水平

为了验证AREX是否具备真实自主研究能力,智源研究院在六个基准上进行了评测,包括:BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510 和HLE with tools。它们分别覆盖信息深度、信息广度、深度与广度结合,以及端到端 Agent能力。

 

正在上传…重新上传取消

 

信息深度:在多跳信息中持续挖掘

BrowseComp和xbench-2510的任务设计颇为苛刻:问题往往嵌入了多个相互约束的条件,正确答案隐藏在分散的网页与间接证据之中,模型需要沿着线索逐级深入挖掘。AREX-Base在BrowseComp上达到82.5,接近GPT-5.4、Kimi-K2.6、DeepSeek-V4-Pro和Claude Opus-4.6,同时超过GLM-5与Qwen3.5-397B。在xbench-2510 上,它接近MiroThinker-H1,并优于Qwen3.5-397B与DeepSeek-V4-Flash。结果表明,AREX能力提升并非来自更多轮次的搜索堆砌,而是源于更稳定的研究状态维护——模型能够保留已验证信息、排除错误候选,并持续围绕尚未解决的约束推进。

信息广度:在大规模信息空间中全面覆盖

WideSearch-en考察的是另一项能力:在大规模搜索空间中尽可能完整地找到目标条目,并完成去重、核验与汇总。AREX-Base在该基准上取得了82.0 Item-F1,超越了Kimi-K2.6、DeepSeek-V4-Pro、GPT-5.4等模型。结果表明,AREX不只擅长“挖深一个答案”,也能管理大范围搜索任务,在长程检索中持续维护已覆盖范围和剩余空白。

深度与广度的结合:可迁移的研究方法论

DeepSearchQA同时要求多步检索、证据推理与答案完整性,是深度与广度的综合测试。AREX-Base在这里取得了89.9 F1,超过GPT-5.4与DeepSeek-V4-Pro和 Qwen3.5-397B,并接近Claude Opus-4.6、Kimi-K2.6和Gemini-3.1-Pro。这说明AREX学到的不是某个特定领域的搜索技巧,而是一套可迁移的研究方法论:检索、比较、验证、修正、聚合。

端到端能力:从搜索到完整研究流程

GAIA和HLE with tools进一步要求模型将搜索与规划、推理、工具调用结合起来。AREX-Base在三项测试上分别取得85.4、71.0和52.4。在GAIA上,它超过Kimi-K2.6、Gemini-3.1-Pro和Qwen3.5-397B;在HLE文本子集测评下,它超过GLM-5、DeepSeek-V4-Pro、Qwen3.5-397B和MiroThinker-H1。这说明AREX的能力可以从搜索任务迁移到完整智能体工作流:模型不仅能找到信息,还能规划行动、调用工具、验证中间结论,并组织最终答案。

总体性能对比:开源前沿、闭源旗舰与同量级模型

与开源前沿模型相比,AREX-Base在双方均报告的BrowseComp、GAIA、WideSearch-en和HLE文本子集上全部领先。与DeepSeek-V4-Pro相比,AREX-Base在DeepSearchQA、WideSearch-en和HLE文本子集上更高。与Kimi-K2.6相比,AREX-Base在GAIA和WideSearch-en上领先,在BrowseComp上接近,但在xbench-2510和DeepSearchQA上仍有差距。测评结果显示AREX不是“所有单项都领先”,而是以10B激活参数,在深搜、广搜、端到端智能体和工具推理之间取得了均衡的综合竞争力。

与闭源旗舰模型相比,面对GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro等闭源旗舰,AREX-Base同样进入多个高难度基准的竞争区间。它在BrowseComp上与GPT-5.4几乎持平,在DeepSearchQA上超过GPT-5.4,在WideSearch-en上超过GPT-5.4、Claude Opus-4.6和Gemini-3.1-Pro。

与同量级基础模型与智能体模型相比,AREX-Base的总参数量为122B,每次推理仅激活10B参数。相比同总参数量的Qwen3.5-122B,AREX-Base在双方均报告的指标上全部提升;相比更大规模的Qwen3.5-397B,AREX-Base在六项完整可比基准上全部领先。与专门面向搜索和研究任务训练的智能体模型相比,AREX也体现出较高的参数效率。AREX-Turbo只有4B参数,但在多项指标上超过Qwen3.5-35B、Quest-35B和 Tongyi-DeepResearch-30B;AREX-Base则在DeepSearchQA和HLE文本子集上超过 MiroThinker-H1,并在xbench-2510上与其接近。这说明自主研究能力并不只来自扩大参数规模,也来自对长程研究过程的专门训练。

 

本地部署

AREX-Base 总参数量 122B、激活 10B,上下文长度 262,144 tokens,官方推理示例以 8 卡张量并行为起点,可按实际卡型与显存调整并行度和最大上下文长度。除 vLLM 外,SGLang 及其他支持 Qwen3.5 的 OpenAI 兼容推理服务同样可用;对成本敏感的场景可换用同系列的 AREX-Turbo(4B)。

模型下载

modelscope download --model BAAI/AREX-Base --local_dir ./AREX-Base

启动 vLLM 服务

在模型仓库根目录下执行:

vllm serve . \
 --served-model-name AREX-Base \
 --tensor-parallel-size 8 \
 --max-model-len 262144 \
 --reasoning-parser qwen3 \
 --language-model-only

关键参数说明:--tensor-parallel-size 为张量并行度,按可用卡数调整;--max-model-len 262144 对应模型完整的 256K 上下文,显存不足时可下调;--reasoning-parser qwen3 用于解析 Qwen3.5 的思考内容;--language-model-only 表示纯文本部署。

发起一次推理

安装客户端并发送一个 BrowseComp 风格的问题:

pip install -U openai
export AREX_BASE_URL="http://127.0.0.1:8000/v1"
export AREX_API_KEY="EMPTY"
export AREX_MODEL="AREX-Base"
python inference/inference.py --question "Your BrowseComp question"

脚本只返回模型的下一步动作,工具执行由调用方完成。当模型输出 XML 格式的 <tool_call> 时,需要执行对应工具,把助手输出追加进消息历史,再将真实的工具结果按下列格式回填:

<tool_response>
actual tool result
</tool_response>

循环这一过程直到模型调用 finish。BrowseComp 场景下开放的工具为 searchgoogle_scholarvisitupdate_contextfinish

直接使用官方 Prompt

inference/prompts.py 导出了 BrowseComp 的 system 与 user prompt 常量,工具描述已内置在 system prompt 中,只需填入问题:

from inference.prompts import (
 BROWSECOMP_SYSTEM_PROMPT,
 BROWSECOMP_USER_PROMPT,
)
question = "Your BrowseComp question"
messages = [
 {"role": "system", "content": BROWSECOMP_SYSTEM_PROMPT},
 {"role": "user", "content": BROWSECOMP_USER_PROMPT.format(question=question)},
]

build_messages(question) 是同样格式化逻辑的便捷封装,可直接配合 OpenAI SDK 调用已启动的服务。

 

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐