众智FlagOS模型适配再扩军!11款AI芯片已就位,ARM CPU也能玩转270亿大模型
阿里巴巴开源视觉语言模型 Qwen3.8-27B,众智 FlagOS 社区同步完成多芯片适配。Qwen3.8-27B 已在平头哥、英伟达、摩尔线程、沐曦、昆仑芯、华为昇腾、海光、天数智芯、清微智能、燧原、曦望等11款 AI 芯片上完成基于 FlagOS 统一开源技术栈的多芯适配、精度对齐与部署验证,其中摩尔线程支持 FP8 精度部署,其余芯片为 BF16。同时,FlagOS 首次将 Qwen 最新版本模型的适配延伸至 ARM 端侧平台,以 W4A8 低比特版本运行,性能均明显优于 vLLM 及 llama.cpp 的原生版本,开发者可直接获取对应平台的开箱即用方案。
据官方模型介绍,Qwen3.8-27B 为 27B 稠密模型,原生上下文 262,144 tokens,具备以下增强特性:
-
核心能力:在代码生成、专业工作、科研和长周期智能体任务方面实现全面改进。
-
智能体执行:更强的自主规划能力与更优的环境反馈处理能力,从而实现更可靠的端到端任务完成。
-
下游兼容性:更广泛地支持主流评测框架和开发工具,便于集成到您现有的技术栈中。
-
灵活的思维控制:默认启用思维模式,可按请求禁用;可通过 reasoning_effort 调整推理深度,并通过 preserve_thinking 保留历史消息中的推理上下文。
-
视觉-语言理解:原生支持图像和视频理解,涵盖 STEM 图表、文档乃至长达数小时的视频。
Part 1
ARM CPU 驱动270亿参数大模型:基于 FlagOS Qwen3.8-27B 纯 CPU 高性能推理
ARM 广泛存在于 AIPC、机器人、车载终端、边缘网关和各类嵌入式设备中,是端侧 AI 部署覆盖最广的计算平台。此前 FlagOS 已在 MiniCPM5-1B 这类10亿参数端侧基座模型上验证过 ARM 平台的 Day-0 适配能力,Qwen3.8-27B 则是 FlagOS 首次把 270亿参数的稠密大模型适配到 ARM 端侧平台。
27B 在纯 CPU 环境下运行,主要约束是内存容量与访存带宽,本次采用 W4A8 量化路径(权重 4bit、激活为动态 INT8)压低模型体积与访存开销。相应地,该版本主要面向 AI PC、边缘服务器这类内存较充裕的 ARM 边缘设备,而非手机等移动终端。
本次优化面向 ARM 平台纯 CPU 模式下的单流推理场景。框架层由 vLLM-plugin-FL 补齐原生 vLLM 对 packed compressed-tensors W4A8 G128、Qwen Hybrid/GDN 和动态 INT8 激活的支持,并确保推理过程实际使用优化后的高性能算子,避免回退到低性能实现。运行层采用 UniProc,使模型执行与服务调度处于同一进程,减少 Worker 进程间通信、重复运行时状态和额外同步,尤其适合 Batch=1 的端侧低时延场景;按 Prefill 与 Decode 分别进行线程调优,进一步降低 OpenMP 重复启动和异构核心同步造成的损耗。
算子层由 FlagGems 承接,结合 KleidiAI 等 ARM 高性能算子库的数据布局与微内核能力,并通过 Triton CPU 完成算子编译与调度。Prefill 采用 I8MM 优化大矩阵计算,Decode 采用面向 M=1 的 SDOT 内核和流式访存策略;同时融合 SwiGLU 和 GDN 双 Linear,共享多个线性层的输入预处理结果,避免重复量化和数据重排;通过动态分配计算任务,减少 CPU 核心空闲和线程等待,并为 GDN Conv1D、递归和 Norm 等关键计算提供专用高性能实现。FlagGems 优化算子在 Prefill 和 Decode 阶段分别覆盖约 90% 和 92% 的计算时间。
在 Mac M5 Pro(18 核 CPU)、Batch=1、纯 CPU 推理的情况下,优化版达到 Prefill 74.93 tok/s、Decode 12.73 tok/s,均明显优于 vLLM 和 llama.cpp 的原生性能:
|
方案 |
Prefill |
Decode (tok/s) |
端到端 (tok/s) |
|
FlagOS 优化版 |
74.93 |
12.73 |
38.07 |
|
vLLM 基线 (未优化) |
45.7 |
6.44 |
20.7 |
|
llama.cpp Q4_K_M |
47.94 |
11.68 |
29.69 |
相比未优化 vLLM 基线,Prefill 提升 64%,Decode 提升 98%,端到端耗时由 30.92 秒降至 16.81 秒;相比 llama.cpp Q4_K_M,Prefill 领先 56%,Decode 领先 9%,总吞吐领先约 28%。
本次在ARM端的适配,让同一个模型与调用接口既可以跑在数据中心的多款 AI 加速卡上,也可以下沉到 ARM 设备侧,为低时延、离线可用和数据不出端的场景多提供一条路径。
Part.2
开发者速用指南
FlagOS 为 Qwen3.8-27B 提供了统一支持多种 AI 芯片的推理插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL 两种推理框架插件。目前在 FlagOS 推理插件的支持下,平头哥、英伟达、摩尔线程、沐曦、昆仑芯、华为昇腾、海光、天数智芯、清微智能、燧原、曦望等芯片及 ARM 端侧平台已完成 Qwen3.8-27B 的推理部署验证,业务代码与标准调用接口无需修改,环境依赖、模型路径与启动参数按各芯片模型卡配置。
使用源码安装部署,可参考以下官方文档。
vLLM-plugin-FL
- GitHub:https://github.com/flagos-ai/vllm-plugin-FL/blob/main/README.md
- GitCode:https://gitcode.com/flagos-ai/vllm-plugin-FL/blob/main/README.md
SGLang-plugin-FL
- GitHub:https://github.com/flagos-ai/sglang-plugin-FL/blob/main/README.md
- GitCode:https://gitcode.com/flagos-ai/sglang-plugin-FL/blob/main/README.md
方式一:FlagOS 安装部署
快速安装(以 vLLM 为例)
以平头哥平台的验证为例。其他芯片的运行时版本、插件分支、FlagGems/FlagTree 提交以及是否需要 FlagCX,请以对应芯片的模型卡和 vLLM-plugin-FL / SGLang-plugin-FL 仓库 README 为准。使用 SGLang 请替换为 sglang-plugin-FL 的安装步骤。
# 1. 安装 vLLMgit clone https://github.com/vllm-project/vllm.gitcd vllmgit checkout v0.24.0VLLM_TARGET_DEVICE=empty pip install -v --no-build-isolation --no-deps .# 2. 安装 vllm-plugin-FLgit clone https://github.com/flagos-ai/vllm-plugin-FLcd vllm-plugin-FLgit checkout v0.3.0-devpip install --no-build-isolation -e .# 3. 安装 FlagGems 算子库git clone https://github.com/flagos-ai/FlagGemscd FlagGems && git checkout v5.3.0pip install --no-build-isolation -e .# 4. (可选) 安装 FlagTree 跨芯编译器# 5. (可选) 安装 FlagCX 跨芯通信库# 详见 https://github.com/flagos-ai/FlagCX
运行推理
以下为平头哥平台 INT8 版本的示例,模型路径、tensor_parallel_size、max_num_batched_tokens、max_num_seqs 等参数需按实际芯片型号、卡数与服务配置调整,各芯片的推荐取值见对应模型卡。
from vllm import LLM, SamplingParams
prompts = ["请介绍下阿里巴巴开源最新模型QWen3.8"]sampling_params = SamplingParams(max_tokens=10, temperature=0.0)llm = LLM(model="FlagRelease/Qwen3.8-2.4T-A95B-INT8-zhenwu-FlagOS",max_num_batched_tokens=8192,max_num_seqs=32,tensor_parallel_size=16,pipeline_parallel_size=2)outputs = llm.generate(prompts, sampling_params)for output in outputs:print(f"Prompt: {output.prompt!r}")print(f"Generated: {output.outputs[0].text!r}")
方式二:模型镜像直接下载
用户也可以直接拉取在 FlagRelease 上发布的迁移后的模型文件、代码和镜像,开箱即用、无需迁移。
魔搭社区

Hugging Face

此外,腾讯云 HAI 社区和超算互联网等多个云平台已将 FlagOS 适配的模型纳入其容器镜像中心,开发者可直接拉取镜像并部署至云端加速卡,快速构建面向自身业务的 MaaS 推理服务。

Part.3
开发者体验
1.零改码适配
模型原有接口、vLLM 推理引擎使用逻辑以及开发者的日常调用代码均无需修改。FlagOS 通过 vLLM 的多芯片插件(vLLM-plugin-FL),把算子实现从 CUDA 替换为基于 Triton 语言的 FlagGems 算子库,由插件层完成与各芯片后端的对接。开发者无需了解硬件相关的底层开发知识。
2.核心能力与原生版本对
我们在 GPQA_Diamond、MUSR 两个评测集上,将各芯片 FlagOS 版本与英伟达 H100 原生版本做了对照,从评测结果看,与CUDA原生结果对齐。
评测数据

注:本测试结果仅用于在同一测试环境下的对齐验证,并不代表Qwen模型的官方性能。Qwen 模型的官方性能以 Qwen 官方公布数据为准。
3. 开箱即用部署
FlagRelease 直接提供了多芯片版本的 Qwen3.8-27B-FlagOS 模型版本和配套镜像,其中已预置 FlagGems 算子库、FlagTree 编译器等组件,加载模型时底层优化自动生效,开发者无需添加 FlagOS 初始化代码,也无需自行迁移。若不使用 FlagRelease 镜像而采用源码方式部署,则需按前文步骤自行安装 vLLM-plugin-FL 与 FlagGems。
Part.4
大模型核心基座:FlagOS 五大技术支撑,实现极速跨芯适配
包括 Qwen3.8-27B 在内的多款模型跨芯适配,依托的是 FlagOS 2.1 统一多芯片系统软件栈,从算子层、编译层、框架层到工具层为跨芯适配提供支撑。

1. 统一多芯片推理框架插件
FlagOS 为主流推理框架提供统一的多芯片插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL,基于 FlagOS 统一多芯片后端开发,在不改变原生接口与用户使用习惯的前提下实现 Qwen3.8-27B 的多芯片推理部署。本次适配中,两款插件已在英伟达、摩尔线程、沐曦、昆仑芯、平头哥、华为昇腾、海光、天数智芯、清微智能、燧原、曦望等芯片上完成功能跑通与部署验证,精度对齐进度以评测章节的表格为准。各芯片支持的框架版本与并行配置请参考对应模型卡,用户可根据业务场景选择 vLLM 或 SGLang。
2. 多芯片量化压缩工具 FlagOS-Compress
FlagOS-Compressor 是 FlagOS 面向大模型压缩与高效部署的模型优化工具,聚焦模型量化等压缩技术。针对Qwen3.8-2.4T这类参数规模较大的模型,通过量化降低模型权重、激活等数据的存储与计算开销,延续 FlagOS “统一软件栈 + 多芯片适配”的整体思路,服务于平头哥、华为、海光、英伟达等AI 芯片平台上的高效部署。
3. 高性能算子库 FlagGems
FlagGems 是 FlagOS 核心的高性能通用大模型算子库,基于 Triton 语言实现,覆盖注意力计算、归一化、旋转位置编码、量化线性计算等大模型推理关键模块。算子库当前支持英伟达、摩尔线程、沐曦、清微智能、天数智芯等多家 AI 芯片,并提供面向 ARM CPU 后端的算子实现。Qwen3.8-27B 在各芯片上实际启用的算子集合以模型卡说明为准。
4. 统一 AI 编译器 FlagTree
FlagTree 是 FlagOS 面向多 AI 芯片后端的统一编译器,基于 Triton 深度定制,可将 Qwen3.8-27B 的核心算子编译为英伟达、摩尔线程、沐曦、昆仑芯、平头哥、华为昇腾、海光、天数智芯、清微智能等多个 AI 芯片后端可识别的指令,解决不同芯片编译器生态割裂的问题。本次适配中,FlagTree 的 Armv9 CPU 编译目标(FlagTree-CPU)承担了 ARM 端侧版本的编译工作。
5. 模型跨芯迁移发布工具 FlagRelease
依托 FlagOS 全栈技术能力,FlagRelease 已完成 Qwen3.8-27B 在多种芯片上的模型迁移、精度对齐与版本发布,覆盖 HuggingFace、魔搭等开源社区平台。开发者可直接下载使用,无需自行迁移。截至 2026 年 8 月,FlagRelease 已发布覆盖 10+ 家芯片厂商、12+ 款硬件、80+ 个开源模型实例的跨芯适配版本。
Part.5
开源共建:FlagOS 持续做开发者的“跨芯适配后盾”
当下,“异构算力协同、大模型普惠落地”已成为全球开源开发者社区的核心热点,打破硬件生态隔离、让大模型在不同算力平台高效低成本运行,是无数开发者的核心诉求。FlagOS 从诞生之初就将开源开放、众智共建刻入技术基因,始终以开发者为中心,通过全栈开源的统一系统软件栈,把复杂的“M×N”硬件适配问题降维为“M+N”,做每一位开发者最可靠的跨芯适配后盾。
全栈开源无保留,把技术主动权交给开发者
目前,FlagOS 已形成完整的开源技术体系,所有核心组件均已开源在 GitHub,同时开放了数十款最新的主流基础大模型、十多款 AI 芯片的适配方案与最佳实践:
-
四大核心技术库: FlagGems 通用大模型算子库、FlagTree 统一 AI 编译器、FlagScale 训练推理并行框架、FlagCX 统一通信库,覆盖算子开发、编译优化、并行计算、跨芯片通信全链路;
-
三大开源工具平台: FlagRelease 大模型自动迁移发版平台、KernelGen 算子自动生成工具、FlagPerf 多芯片评测工具,提供从模型适配、性能评测到工程落地的一站式工具链;
-
全场景扩展生态: vLLM-plugin-FL、SGLang-plugin-FL、Megatron-LM-FL、TransformerEngine-FL 等框架增强组件,以及 FlagOS-Robo 具身智能工具包,覆盖大模型训练、推理、应用全场景。
多路径参与共建
我们为不同技术方向、不同经验层级的开发者设计了低门槛、多路径的共建方式:
-
新手友好型参与: 可在对应仓库提交 Issue 反馈 bug、优化建议,或是补充完善文档、撰写入门教程与最佳实践,也可参与社区技术交流、分享使用经验;(社区文档参考:https://docs.flagos.io/en/latest/)
-
深度技术共建: 开发者可直接参与 FlagGems 算子开发与优化(新增算子 / 性能调优 / 新芯片后端支持)、KernelGen 算子生成流程增强、FlagTree 编译器后端扩展等核心模块,与社区核心开发者一起推动技术演进。
-
生态工具贡献: 开发者可基于 FlagOS Skills 开发面向国产芯片的 AI Agent 专业技能,帮助更多开发者通过自然语言完成芯片适配、模型部署等操作。
欢迎来到FlagOS开发社区,这里是一个汇聚了AI开发者、数据科学家、机器学习爱好者以及业界专家的活力平台。我们致力于成为业内领先的Triton技术交流与应用分享的殿堂,为推动人工智能技术的普及与深化应用贡献力量。
更多推荐




所有评论(0)