Qwen3.8-Flash-Next 开源:125B 主模型激活 6B,预览 Qwen4 全新架构
Qwen 家族开源 Qwen3.8-Flash-Next,这是一个开源权重的多模态 MoE 模型,同时作为 Qwen4 所用模型结构的先导预览。Qwen3.8-Flash-Next 的主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。原生支持 262,144 Token 上下文,并可通过 YaRN 扩展至 1,000,000 Token。
这次模型架构更新围绕 Attention、Residual、Embedding 和 Optimization 四个部分展开。相比于 Qwen3.7-Plus,Qwen3.8-Flash-Next 的训练开销约为前者的 1/9,并在代码、办公领域取得了更优的结果,实现了模型能力、响应延迟与推理成本之间的平衡。
- 模型下载:
https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
- 官方博客:
https://qwen.ai/blog?id=qwen3.8-flash-next

性能表现
纯文本

多模态

技术亮点
模型结构

Attention:GDN + QSA,高效记忆与精准检索
传统 Full Attention 可以直接访问所有历史 token,但上下文越长,计算和 KV Cache 访存成本越高。
Qwen3.8-Flash-Next 延续了 Qwen3.5 的架构设计,采用 GDN + Attention 的 Hybrid 架构:每四层中三层使用 Gated DeltaNet(GDN),将历史信息持续压缩到固定大小的状态中;另一层保留全局 Attention,负责精确检索全局信息。
对于全局 Attention,Qwen 进一步引入 Qwen Sparse Attention(QSA)。Sparse Attention 通过只关注重要上下文来减少长序列下的计算,但现有方案如 DSA 通常仍需要一个 token 级 indexer 来寻找重要位置;随着上下文增长,indexer 本身的计算也会逐渐成为不可忽略的开销。
QSA 将这一过程进一步压缩:轻量 indexer 先把序列聚合成 micro-block,在 block 粒度上估计上下文重要性,再选出最相关的区域执行 Attention。这样不仅减少了实际 Attention 的计算量,也显著降低了“寻找重要上下文”本身的 indexing 成本。相比跨层共享索引的方法,QSA 在每一层内部独立完成序列压缩,对跨层 Attention 相似性的依赖更小,也更适合 GDN 与 Attention 交替出现的 Hybrid 架构。

GDN 负责高效“记住”,QSA 负责精准“查找”
在 1M token 上,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6× 和 4.9× 的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache 命中率为 90%),Qwen3.8-Flash-Next 在 1M 上下文下的 Prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。

Gated Residual:给信息更多传递路径
传统 Transformer 各层持续在同一条 Residual Stream 上读写信息。Qwen3.8-Flash-Next 引入 Gated Residual,将残差流扩展为 4 条并行分支,并通过逐元素的动态 Read Gate 和按分支控制的 Write Gate 调节信息流动。其中一条分支会自然形成连接第一层 Attention 与多数中后层的长距离通道。
归一化后的 Gate 还进一步简化了 Hyper-Connection ,用于抑制 Activation Outlier,Residual State 支持以 FP8 保存,以减少访存开销。
Optimization:架构和优化协同设计
Qwen3.8-Flash-Next 使用 Muon Optimizer 训练,并围绕三个关键问题进一步优化 Muon 在大模型训练中的使用方式:正交化精度、Muon 与 AdamW 的参数分工,以及融合参数矩阵的拆分。
对于真正作为二维线性映射的参数,例如 Attention、GDN 和 MoE Expert 中的主要权重,Qwen 使用 Muon;Embedding、MoE Router、GR 低秩参数等则继续使用 AdamW。对于工程实现中融合存储的 QKV、SwiGLU 和 GDN Projection,则先按照实际对应的独立线性变换进行拆分,再分别执行正交化。
针对新的模型结构和 Optimizer,Qwen重新拟合了 Scaling Law。可以使用更大的 Learning Rate 和 Batch Size,进一步提升收敛效率和大规模并行训练吞吐。
极致稀疏 MoE
在全局负载均衡下,固定激活专家数量而持续增加专家总参数量,可稳定降低训练 loss。因此 Qwen3.8-Flash-Next 采用较大的专家池,每 token 只路由少量专家,并配合一个共享专家。
Multi-Token Prediction
MTP 模块以多步方式训练,保持训练与推理之间的一致性,从而提升实用场景下 speculative decoding 的接受率,同时也提升主干本身的性能。其中的全注意力层同样被替换为 QSA。
Base 模型表现
Qwen3.8-Flash-Next-Base 与 Qwen3.8-27B 及 Qwen3.7-Plus 的 base 模型比较,在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果。

模型下载与推理
Qwen3.8-Flash-Next 已上线魔搭社区,开发者可通过 SGLang、vLLM、TokenSpeed、Unsloth 等推理框架部署。
模型下载
魔搭模型:https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
pip install -U modelscope
modelscope download \
--model Qwen/Qwen3.8-Flash-Next \
--local_dir ./Qwen3.8-Flash-Next
推理框架
正式部署时建议使用各框架针对 Qwen3.8-Flash-Next 提供的最新 Recipe,并根据权重精度、GPU 型号与数量选择并行策略:
- SGLang:https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-Flash-Next
- vLLM:https://recipes.vllm.ai/Qwen/Qwen3.8-Flash-Next
- TokenSpeed:https://lightseek.org/tokenspeed/recipes/models#qwen3-8-flash-next
- Unsloth: https://unsloth.ai/docs/models/qwen3.8-next
API 使用
Qwen3.8-Flash-Next 默认运行在思考模式下,会先生成由 <think>\n...</think>\n\n 标识的思考内容,再输出最终回答。如需关闭思考内容并直接获取回答,可参考下文的“指令或非思考模式”示例。
建议使用以下采样参数:
- 思考模式:
temperature=1.0、top_p=0.95、top_k=20、min_p=0.0、presence_penalty=0.0、repetition_penalty=1.0 - 指令(非思考)模式:
temperature=0.7、top_p=0.80、top_k=20、min_p=0.0、presence_penalty=1.5、repetition_penalty=1.0
不同推理框架对采样参数的支持范围可能不同。在多轮 Agent 任务中,降低推理强度不一定能够缩短任务的总完成时间。虽然单轮响应可能更快,但分析不足也可能导致更多失败与重复尝试,从而增加总体延迟和 Token 消耗。
Qwen3.8-Flash-Next 支持通过 enable_thinking、preserve_thinking 和 reasoning_effort 控制思考行为。
Chat Completions API
Chat Completions API 可以配合多数推理框架使用,也可以通过 Qwen Cloud 调用。开始前,请安装所需依赖,并配置 API Key 和 API Base URL,例如:
pip install -U openai
# Set the following accordingly
export OPENAI_BASE_URL="http://localhost:8000/v1"
export OPENAI_API_KEY="EMPTY"
指令或非思考模式
Qwen3.8-Flash-Next 默认会先进行思考再生成回答。通过配置 API 参数,可以让模型直接输出回答而不生成思考内容。例如:
from openai import OpenAI
# Configured by environment variables
client = OpenAI()
messages = [
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png"
}
},
{
"type": "text",
"text": "Where is this?"
}
]
}
]
chat_response = client.chat.completions.create(
model="Qwen/Qwen3.8-Flash-Next",
messages=messages,
temperature=0.7,
top_p=0.8,
presence_penalty=1.5,
extra_body={
"top_k": 20,
"chat_template_kwargs": {"enable_thinking": False},
},
)
print("Chat response:", chat_response)
如果使用 Qwen Cloud API,除修改 model 外,请直接使用 "enable_thinking": False,而不是 "chat_template_kwargs": {"enable_thinking": False}。
关闭保留思考
默认情况下,Qwen3.8-Flash-Next 会保留所有历史消息中的思考块,从而在整段对话中维持完整的推理轨迹。这一行为称为“保留思考”(preserved thinking),有助于在 Agent 场景中维持决策一致性并减少重复推理,同时还能提高 KV Cache 利用率,优化思考模式与非思考模式下的推理效率。
如果只希望保留最新一条用户消息对应的思考块,可以将 preserve_thinking 设置为 False:
from openai import OpenAI
# Configured by environment variables
client = OpenAI()
messages = [...]
chat_response = client.chat.completions.create(
model="Qwen/Qwen3.8-Flash-Next",
messages=messages,
extra_body={
"chat_template_kwargs": {"preserve_thinking": False},
},
)
print("Chat response:", chat_response)
如果使用 Qwen Cloud API,除修改 model 外,请直接设置 "preserve_thinking": False,不要将其包裹在 chat_template_kwargs 中。
ms-swift 微调
ms-swift day0 支持了 Qwen3.8-Flash-Next 模型的微调, ms-swift是魔搭社区官方提供的大模型训练框架,开源地址:https://github.com/modelscope/ms-swift
环境准备:
pip install git+https://github.com/modelscope/ms-swift.git
pip install git+https://github.com/modelscope/mcore-bridge.git
pip install git+https://github.com/huggingface/transformers.git
# flash-linear-attention
pip install -U flash-linear-attention --no-build-isolation
pip install -U git+https://github.com/Dao-AILab/causal-conv1d --no-build-isolation
# flash-attention
pip install "flash-attn==2.8.3" --no-build-isolation
# deepspeed
pip install deepspeed
megatron 训练的相关环境安装参考文档:https://swift.readthedocs.io/zh-cn/latest/Megatron-SWIFT/Quick-start.html
我们介绍使用 ms-swift 对 Qwen3.8-Flash-Next 进行自我认知微调,并对微调后模型进行推理。
自我认知数据集链接:https://modelscope.cn/datasets/swift/self-cognition
# 8*80G
megatron sft \
--model Qwen/Qwen3.8-Flash-Next \
--dataset 'swift/self-cognition
#500
' \
--model_name swift-robot\
--model_author swift \
--tuner_type lora \
--lora_rank 8 \
--lora_alpha 32 \
--target_modules in_proj out_proj linear_proj linear_qkv \
--tensor_model_parallel_size 2 \
--expert_model_parallel_size 4 \
--expert_tensor_parallel_size 1 \
--pipeline_model_parallel_size 2 \
--decoder_first_pipeline_num_layers 12 \
--sequence_parallel true \
--context_parallel_size 1 \
--moe_grouped_gemm true \
--moe_permute_fusion true \
--moe_aux_loss_coeff 1e-3 \
--micro_batch_size 1 \
--global_batch_size 8 \
--recompute_granularity full \
--recompute_method uniform \
--recompute_num_layers 1 \
--num_train_epochs 3 \
--finetune true \
--cross_entropy_loss_fusion true \
--lr 1e-4 \
--lr_warmup_fraction 0.05 \
--min_lr 1e-5 \
--max_length 2048 \
--split_dataset_ratio 0.01 \
--eval_steps 1000 \
--save_steps 50 \
--save_safetensors true \
--merge_lora true \
--use_precision_aware_optimizer true \
--no_save_optim true \
--no_save_rng true \
--attention_backend auto \
--padding_free false \
--vit_attn_impl sdpa \
--dataloader_num_workers 4 \
--dataset_num_proc 4 \
--load_from_cache_file true \
--logging_steps 1 \
命令行参数含义及更多参数参考文档 https://swift.readthedocs.io/zh-cn/latest/Megatron-SWIFT/Command-line-parameters.html
对验证集进行推理:
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
swift infer \
--adapters output/vx-xxx/checkpoint-xxx-merged \
--infer_backend vllm \
--stream true \
--load_data_args true \
--enable_thinking false \
--vllm_tensor_parallel_size 8
如果您需要自定义数据集微调模型,你可以将数据准备成以下格式:
{"messages": [{"role": "user", "content": "What is the capital of Zhejiang?"}, {"role": "assistant", "content": "The capital of Zhejiang is Hangzhou."}]}
{"messages": [{"role": "user", "content": "浙江的省会在哪?"}, {"role": "assistant", "content": "浙江的省会在杭州。"}]}
更多自定义数据格式参考文档 https://swift.readthedocs.io/zh-cn/latest/Customization/Custom-dataset.html
推送微调后的模型到ModelScope:
swift export \
--adapters output/vx-xxx/checkpoint-xxx \
--push_to_hub true \
--hub_model_id '<your-model-id>' \
--hub_token '<your-sdk-token>'更多推荐




所有评论(0)