刚刚,Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重!
 

Qwen-Max 级别的模型首次开源权重:模型总参数为 2.4T,每个 Token 激活 95B 参数,原生支持 262,144 Token 上下文,并可扩展至 1,010,000 Token。

Qwen3.8 延续 Qwen3.5 的混合架构,重点提升编程、办公、科研和长周期 Agent 任务的端到端完成能力。官方云端版 Qwen3.8-Max 基于该开放权重模型,并加入更多生产环境能力。

官方公布的评测覆盖编程 Agent、通用 Agent、专业工作和长上下文等方向;与 Opus 4.8、Fable 5、GPT 5.6 Sol 等模型相比,各项结果互有高低,并在 PaperBench、IFBench 等Bennchmark中取得所列模型中的较高成绩。

  • 模型:https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B
  • blog:https://qwen.ai/blog?id=qwen3.8
  • Qwen Studio:https://chat.qwen.ai

 

 

效果与能力

十天级自主编程:构建自进化 Harness

在此案例中,Qwen3.8-Max 被要求从空文件夹出发,创建 oh-my-cli 项目和一套可持续运行的编程 Harness。模型组合了 Issue 状态机、任务派发、监控、自测试和异常恢复流程, 并将社区实践与用户反馈继续转化为新任务。

截至官方记录的统计时点,该流程在无人工介入的情况下连续运行约 16 天,留下 265 次 Commit 和 127 个 PR。完整轨迹保存于官方公开的 GitHub 仓库 qwen-code-dev-bot/oh-my-cli。

📎qwen38-autonomous-coding.mp4

 

复现论文并继续改进

在另一项任务中,Qwen3.8-Max 在没有起始代码的情况下,复现《Unified Data Selection for LLM Reasoning》的训练与评测流程。在此过程中,模型连续工作约 125 小时,编写约 7,600 行代码,执行超过 1,100 步操作和 33 轮 GPU 训练。

模型先复现了论文的六项主要结论,随后在四轮探索中自主提出并验证 18 种改进方法。最终方案在该案例的 AIME24 受控实验中,较复现基线再提高 2.71 分。

 

在数百种高价值职业上检验工作能力的广度

Qwen 官方还集中展示了模型在合规审查、产品原型、菜单设计、结构工程、康复演示和体育数据分析等专业任务中的输出。为了检验 Qwen3.8-Max 在真实工作流中交付生产级成果的能力,我们选取了数百种高经济价值职业的高频工作场景进行测试。

📎qwen38-professional-workflows.mp4

 

单轮对话组织端到端策略

Qwen3.8-Max 依托其强大的动态工作流 (Dynamic Workflows),驱动组织数据处理、因子构建、回测和策略迭代,并并行调度多个子任务。从而把一次对话变成端到端、自动化的量化研发闭环。

📎qwen38-quant-research.mp4

 

365 天电商经营模拟

E-Commerce Bench 将模型放入一个为期 365 天的电商经营环境,涵盖 12 种店铺类型、 60 个商品类目、近 600 家供应商和 7,000 种商品。模型需要在季节波动、供应链突发事件、议价与欺诈风险中持续调整采购、定价和库存策略。

Qwen3.8-Max 在超过 2,000 轮交互后,将 10 万元初始资金运营为 416,252 元期末现金。这一结果表明,Qwen3.8-Max 不仅具备长程连贯决策优势,也拥有从交易反馈中自适应学习的能力。

📎qwen38-ecommerce-simulation.mp4

 

技术解读

2. 4T MoE,每个 Token 激活 95B

Qwen3.8-2.4T-A95B 是一个因果语言模型,总参数为 2.4T,每个 Token 激活 95B。模型每个 MoE 层包含 512 个专家,每个 Token 选择 10 个路由专家,并同时激活 1 个共享专家。

“激活 95B”描述的是单 Token 计算路径,不等同于模型权重或运行时显存只需 95B 规模。

原生 256K,可扩展至约 101 万 Token

Qwen3.8-2.4T-A95B 原生上下文长度为 262,144 Token,并可扩展至 1,010,000 Token。模型还进行了多步 MTP(Multi-Token Prediction)训练,为支持相应机制的推理引擎提供预测多个后续 Token 的能力。

MTP 的实际加速效果仍取决于接受率、请求长度和框架实现。

面向真实环境扩展强化学习

在编程之外,真实工作——那些琐碎、多步骤、重度依赖工具、填满几乎每个职业日常的任务——是前沿模型创造经济价值的另一主赛道。为了让 Qwen3.8-Max 在这类工作流中真正胜任且足够稳定,Qwen 团队通过联合扩展强化学习的环境数量与训练算力,实现了扩展真实世界的强化学习系统

Qwen3.8-Max 的办公与 Agent 后训练概括为三个环节:

  1. 持续扩展真实环境,并在这些独立维度上解耦合:任务(Task)(单任务 → 多任务 → 跨天任务)、工作空间(Workspace)(多文件 → 层级目录 → 复杂异构目录)、Harness (不同的类别、版本、技能)。这使得环境数能够以组合方式自然增长,而非依赖逐一定制化集成。
  2. 构建一个统一的奖励系统,将真实任务中异构的验证方式内化其中。该系统涵盖基于执行的校验、对文本及渲染后的视觉输出的 rubric 评估、以及 agentic 检查。我们将多种形式与模态统一在一个奖励系统内,为所有环境提供了一致而可靠的奖励信号,消除维护任务专用的 verifier 所固有的不一致性。
  3. 构建一个在线数据均衡器,对每个 batch 进行重构,使其在任务、难度、工作区与 harness 上的分布高度均衡,降低 batch 间梯度方差,从而支撑强化学习的训练算力稳定、持续地扩展。

图:横轴为 RL 训练环境数量,纵轴为十余项基准组成的 Score Index

图:Qwen3.8-Max 在 QwenWork、Claude Code、Codex、OpenClaw 和 Hermes 等 Harness 下的官方评测结果

 

性能表现

Qwen 公布的结果覆盖编程 Agent、通用 Agent、专业工作、长上下文和视觉 Agent 等方向。在官方所列评测中,Qwen3.8-Max 较 Qwen3.7-Max 在多项编程和通用 Agent 任务上提升明显;与 Opus 4.8、Fable 5 和 GPT 5.6 Sol 等模型相比,不同评测结果互有高低。

以模型卡的结果为例,Qwen3.8-Max 在 PaperBench 上得分 93.0,Terminal Bench 2.1 为 86.6,FrontierSWE 为 73.5,CoWorkBench 为 74.8。这些数据来自 Qwen 官方测试,且各评测的 Harness、超时时间、采样参数和上下文长度并不完全一致。

 

基准评测结果:

 

模型部署

Qwen3.8-2.4T-A95B 的开放权重可从魔搭社区获取。

部署Qwen3.8服务

模型下载

魔搭模型:https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B

pip install -U modelscope
modelscope download \--model Qwen/Qwen3.8-2.4T-A95B \--local_dir ./Qwen3.8-2.4T-A95B

 

推理框架

Qwen3.8-2.4T-A95B 模型可以通过 SGLang、vLLM 和 TokenSpeed 等推理引擎部署。正式部署时需要使用各框架针对 Qwen3.8 的最新 Recipe,并根据权重精度、GPU 型号与数量选择并行策略。

  • SGLang:https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8
  • vLLM:https://recipes.vllm.ai/Qwen/Qwen3.8-2.4T-A95B
  • TokenSpeed:https://lightseek.org/tokenspeed/recipes/models#qwen3-8

API 使用

Qwen3.8 模型默认以思考模式运行。在生成最终回答前,模型会先生成由 <think>\n...</think>\n\n 标记的思考内容。Qwen3.8-2.4T-A95B 不支持关闭思考模式。

推荐使用以下采样参数进行生成:temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

Qwen3.8 原生支持 reasoning_effort,可用于调整推理深度并控制成本:

  • xhigh (默认):适用于需要深入分析的复杂任务
  • medium:在准确性和速度之间取得平衡
  • low:采用更高效的推理方式,侧重速度和成本

 

Chat Completions API

pip install -U openai
# 请根据实际情况设置以下变量export OPENAI_BASE_URL='your-base-url'export OPENAI_API_KEY='your-api-key'

 

纯文本输入


from openai import OpenAI
# 通过环境变量完成配置
client = OpenAI()
messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]
completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-2.4T-A95B",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,  # 默认开启,不应关闭
            "preserve_thinking": True, # 默认开启
        },
    },
    reasoning_effort="xhigh",  # 默认为 xhigh;支持 xhigh、medium 和 low
    stream=True,
    stream_options={"include_usage": True},
)
reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")
for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content
    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

 

如果使用 Qwen Cloud API,除了修改 model 外,请传入 extra_body={"enable_thinking": True, "preserve_thinking": True},而不是 extra_body={"chat_template_kwargs": {"enable_thinking": True, "preserve_thinking": True}}。

 

另,官方预告,更小杯 27B 已在路上,继续期待!

 

 

 

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐