FastFlowLM(FLM)发布 v0.9.46,正式接入魔搭社区(ModelScope)。它是首个专为 AMD Ryzen™ AI NPU 打造的开箱即用推理运行时,使用方式与 Ollama 类似——一行命令拉取模型、一行命令运行,但底层完全针对 NPU 硬件重新设计。此前模型默认从 Hugging Face 拉取,本次新增 --modelscope 1 参数,国内用户可将下载源切换到魔搭,无需更换工具链或配置代理。同期 FastFlowLM 已加入 AMD 官方开源组织 ROCm,成为 AMD AI 推理生态的官方项目之一。相比 iGPU,其 Prefill 最高提速 5.2 倍、Decoding 最高提速 4.8 倍,上下文长度上限达 256K。

 

开源地址:

  • 代码仓库:https://github.com/ROCm/FastFlowLM
  • 官网文档:https://fastflowlm.com
  • 魔搭合集:https://www.modelscope.cn/collections/amd/FastFlowLM

 

FastFlowLM 是什么

FastFlowLM 是首个专为 AMD Ryzen™ AI NPU 打造的开箱即用推理运行时,使用体验与 Ollama 相近,但底层不是把 GPU 方案移植到 NPU,而是从设计之初就面向 NPU 硬件重构。v0.9.46 版本 FastFlowLM 正式加入 AMD 官方开源组织 ROCm(https://github.com/ROCm/FastFlowLM),成为 AMD AI 推理生态的官方项目之一。这也是 FastFlowLM/FastFlowLM 仓库下的最后一个版本,从 v1.0.0 起所有开发迁移至 ROCm/FastFlowLM。

 

技术架构:为 NPU 而生

多数推理框架先在 GPU/CPU 上跑通,再适配到 NPU。FastFlowLM 走相反路径,从第一行代码开始就为 AMD XDNA2 NPU 架构设计。

Tile-aligned 计算调度 NPU 的 AIE(AI Engine)由大量可编程计算 tile 和片上 Memory tile 组成。FastFlowLM 把 Prefill 和 Decoding 拆分成与硬件 tile 对齐的工作负载,并通过 2D-tiled mesh 流式处理 attention 计算,尽量占满片上算力。

KV Cache 常驻片上 NPU 的内存带宽(约 60 GB/s)远低于 GPU(约 125 GB/s)。FastFlowLM 在软件层做了大量 tiling、压缩与调度工作,让 KV Cache 和中间激活值尽量留在 NPU 的 SRAM 中,减少访问 LPDDR5 的开销。

分层软件栈 上层是 C++ AutoModel 框架,负责模型编排与加载;中间是共享计算原语与命令抽象层;底层是直接映射到 AIE 硬件的模型专属 NPU 库(Windows 下为 DLL,Linux 下为 SO)。

自研量化格式 Q4NX 专为 XDNA2 硬件设计的 4-bit 量化格式。模型权重以 .q4nx 格式加载进主机内存,再通过命令调度传输到 NPU 本地内存,在 MatMul 运算中实时反量化,以 INT4 权重 × FP16 激活的方式提高吞吐,同时压低显存与带宽压力。

 

性能表现

这套面向 NPU 的架构带来的性能收益如下表所示(对比基线为同平台 iGPU 与 CPU):

对比基线 Prefill 提速 Decoding 提速 单 token 能耗降低
iGPU 最高 5.2 倍 最高 4.8 倍 最高 67 倍
CPU 最高 33.5 倍 最高 2.2 倍 最高 223 倍

上下文长度上限从 2K 拓展到 256K。

v0.9.46 对 Qwen3.6-MoE 的 Prefill 与 Decoding 吞吐做了进一步优化,各上下文长度下的 Decoding 吞吐(tokens/s)对比:

上下文 优化前 优化后 提升
1k 12.41 13.65 +9.99%
2k 12.26 13.41 +9.38%
4k 11.96 13.09 +9.45%
8k 11.38 12.51 +9.93%
16k 10.40 11.24 +8.08%
32k 8.88 9.51 +7.09%

Prefill 吞吐在各上下文长度下提升 +1.02% 至 +9.02%。

 

手把手体验:从魔搭拉取并运行

第一步:安装 FLM

Windows 用户下载安装包双击安装即可:
https://github.com/ROCm/FastFlowLM/releases/latest/download/flm-setup.msi

Linux 用户可使用便携版,具体见官方文档:
https://fastflowlm.com

第二步:从魔搭拉取模型

安装完成后打开终端,加上 --modelscope 1 参数,模型将从魔搭下载而非 Hugging Face:

# 从魔搭拉取模型
flm pull llama3.2:1b --modelscope 1

 

第三步:直接运行对话

CLI 交互模式下无需先执行 pull,若本地尚未安装模型,flm run 会自动触发下载:

# CLI 模式下自动从魔搭拉取并运行
flm run llama3.2:1b --modelscope 1

 

接入自有应用可使用 Server 模式,对外暴露 OpenAI 兼容接口,同样支持自动下载:

# Server 模式下自动从魔搭拉取
flm serve --modelscope 1

 

 

若本地已有模型,可用以下命令检查与魔搭版本的兼容性:

flm check llama3.2:1b --modelscope 1

 

一个 --modelscope 1 参数,无需更换工具链或配置代理,国内用户即可像使用 Ollama 一样在 NPU 上运行大模型。AMD 在魔搭社区的官方合集已上线,可直接体验(点击阅读原文,即可跳转魔搭合集地址)。

加入 AMD ROCm 与后续规划

加入 AMD ROCm 官方组织后,FastFlowLM 团队正在多个方向推进:模型矩阵持续扩充,从 LLM、VLM 到 VLA 跟进社区热门开源模型的适配与量化,并在 Hugging Face 与魔搭双源发布;围绕 Q4NX 量化、KV Cache 管理与调度策略持续优化,MoE 类模型(如 Qwen3.6-MoE)近期已获得接近两位数的吞吐提升;以 SmolVLA 为起点,将 VLA 能力延伸到机器人感知与决策场景;生态融合方面,FastFlowLM 已作为后端集成进 Lemonade SDK,后续将与更多上层框架、应用打通。

 

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐