FlagOS 让“牛来”模型跑在更多国产芯片上:GLM-5.3-Flash Day0 适配 9 款 AI 芯片
猜了六天的“牛来”模型终于有了答案--它就是智谱开源的多模态 MoE 模型 GLM-5.3-Flash。众智 FlagOS 社区同步完成在平头哥、英伟达、摩尔线程、华为昇腾、海光、沐曦、清微智能、昆仑芯、曦望等 9 家 AI 芯片的 Day0 适配、精度对齐与部署验证,模型镜像已发布到魔搭及 HuggingFace 平台,开发者可直接获取对应芯片的开箱即用方案。
GLM-5.3-Flash 是 GLM-5 系列的首个原生多模态模型,总参数量 320B、每 token 激活 18B。能力超过GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA综合智能指数)中取得 57 分,进入全球前沿模型能力区间,与 Claude Opus 4.8 得分持平。在自研 Z.ai Code Bench 体感评估中,其编程表现与 Claude Opus 4.8 相当。

一、开发者速用指南
FlagOS 为 GLM-5.3-Flash 提供了统一支持多种 AI 芯片的推理插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL 两种推理框架插件。目前在 FlagOS 推理插件的支持下,平头哥、英伟达、摩尔线程、华为昇腾、海光、沐曦、清微智能、昆仑芯、曦望等芯片已经通过不同的推理框架插件方式完成 GLM-5.3-Flash 的推理部署,精度对齐进度以评测章节的表格为准。业务代码与标准调用接口无需修改,环境依赖、模型路径与启动参数按各芯片模型卡配置。
使用源码安装部署,可参考以下官方文档:
-
vLLM-plugin-FL:
- GitHub:https://github.com/flagos-ai/vllm-plugin-FL/blob/main/README.md
- GitCode:https://gitcode.com/flagos-ai/vllm-plugin-FL/blob/main/README.md
-
SGLang-plugin-FL:
- GitHub:https://github.com/flagos-ai/sglang-plugin-FL/blob/main/README.md
- GitCode:https://gitcode.com/flagos-ai/sglang-plugin-FL/blob/main/README.md
方式一:FlagOS 安装部署
快速安装(以 vLLM 为例)
以平头哥平台的验证为例。各芯片的运行时版本、插件分支、FlagGems/FlagTree 提交以及是否需要 FlagCX,请以对应芯片的模型卡和 vLLM-plugin-FL / SGLang-plugin-FL 仓库 README 为准。使用 SGLang 请替换为 sglang-plugin-FL 的安装步骤。
# 1. 安装 vLLM(版本以对应芯片的模型卡为准)
git clone https://github.com/vllm-project/vllm.git
cd vllm
git checkout v0.24.0
VLLM_TARGET_DEVICE=empty pip install -v --no-build-isolation --no-deps .
# 2. 安装 vllm-plugin-FL
git clone https://github.com/flagos-ai/vllm-plugin-FL
cd vllm-plugin-FL
pip install --no-build-isolation -e .
# 3. 安装 FlagGems 算子库
git clone https://github.com/flagos-ai/FlagGems
cd FlagGems && pip install --no-build-isolation -e .
# 4. (可选) 安装 FlagTree 跨芯编译器
# 5. (可选) 安装 FlagCX 跨芯通信库
# 详见 https://github.com/flagos-ai/FlagCX
运行推理
以平头哥平台为例。模型路径、tensor_parallel_size、max_num_batched_tokens、max_num_seqs 等参数需按实际芯片型号、卡数与服务配置调整,各芯片的推荐取值见对应模型卡。
from vllm import LLM, SamplingParams
prompts = ["请介绍下智谱最新开源模型 GLM-5.3-Flash"]
sampling_params = SamplingParams(max_tokens=10, temperature=0.0)
llm = LLM(
model="FlagRelease/GLM-5.3-Flash-BF16-zhenwu-FlagOS",
max_num_batched_tokens=8192,
max_num_seqs=32,
tensor_parallel_size=8)
outputs = llm.generate(prompts, sampling_params)
for output in outputs:
print(f"Prompt: {output.prompt!r}")
print(f"Generated: {output.outputs[0].text!r}")
方式二:模型镜像直接下载
用户也可以直接拉取在 FlagRelease 上发布的迁移后的模型文件、代码和镜像,开箱即用、无需迁移。下表列出已在 FlagRelease 上线的 9 款芯片适配版本。
魔搭平台

HuggingFace 平台

二、开发者体验
1. 零改码适配
模型原有接口、vLLM 推理引擎使用逻辑以及开发者的日常调用代码均无需修改。FlagOS 通过多芯片推理框架插件(vLLM-plugin-FL / SGLang-plugin-FL),把算子实现从 CUDA 替换为基于 Triton 语言的 FlagGems 算子库,由插件层完成与各芯片后端的对接。GLM-5.3-Flash 的线性 + 稀疏混合注意力架构在不同芯片上可用的并行切分方式与执行模式存在差异,各芯片单卡可用显存的差别也直接影响切分选择,这部分同样由插件层承接,开发者无需了解硬件相关的底层开发知识。
2. 核心能力与原生版本对齐
我们在 GPQA_Diamond、MUSR 两个评测集上,将各芯片 FlagOS 版本与英伟达原生版本做了对照,从已出评测结果数据来看,与 CUDA 原生结果对齐。
评测数据

注:本测试结果仅用于在同一测试环境下的对齐验证,并不代表 GLM 模型的官方性能。GLM 模型的官方性能以智谱官方公布数据为准。
3. 开箱即用部署
FlagRelease 直接提供了多芯片版本的 GLM-5.3-Flash-FlagOS 模型版本和配套镜像,其中已预置 FlagGems 算子库、FlagTree 编译器等组件,加载模型时底层优化自动生效,开发者无需添加 FlagOS 初始化代码,也无需自行迁移。若不使用 FlagRelease 镜像而采用源码方式部署,则需按前文步骤自行安装 vLLM-plugin-FL 与 FlagGems。
三、大模型核心基座:FlagOS 五大技术支撑
包括 GLM-5.3-Flash 在内的多款模型跨芯适配,依托的是 FlagOS 2.1 统一多芯片系统软件栈的全链路能力。从算子层、编译层、框架层到工具层,全链路为大模型跨芯适配提供技术支撑。

1. 统一多芯片推理框架插件
FlagOS 为主流推理框架打造了统一的多芯片插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL,基于 FlagOS 统一多芯片后端开发,在不改变原生接口与用户使用习惯的前提下,实现 GLM-5.3-Flash 的多芯片推理部署。本次适配中,英伟达、平头哥、昆仑芯、沐曦、海光、昆仑芯、曦望基于 vLLM-plugin-FL 部署,摩尔线程、华为昇腾基于 SGLang-plugin-FL 部署,精度对齐进度以评测章节的表格为准。两条路径共用同一套 FlagGems 算子实现与同一份 BF16 权重格式,因此切换芯片不需要更换模型文件,只需选择对应的框架插件。插件针对线性 + 稀疏混合注意力下的索引器召回、IndexPool 缓存压缩、mHC 超连接读写,以及 MoE 专家调度、张量并行等环节做了适配与优化,各芯片支持的框架版本与并行配置请参考对应模型卡。用户可根据业务场景选择 vLLM 或 SGLang。
2. 多芯片量化压缩工具 FlagOS-Compress
FlagOS-Compressor 是 FlagOS 面向大模型压缩与高效部署的模型优化工具,聚焦模型量化等压缩技术。本次 GLM-5.3-Flash 首批适配以 BF16 原生权重为主,未走量化路径;FlagOS-Compressor 的多芯片量化能力仍在持续建设,为后续在显存受限芯片上的压缩部署做准备。
3. 高性能算子库 FlagGems 及 FlagGems-vLLM
FlagGems 及 FlagGems-vLLM 是 FlagOS 核心的高性能、多芯片通用算子库,基于 Triton/Triton-TLE 语言实现。FlagGems 对应了 PyTorch 的算子库,FlagGems-vLLM 对应了 vLLM 推理框架的大量融合算子。本次针对 GLM-5.3-Flash 推理链路,除 MoE 专家调度与 Attention 计算等既有算子外,按新架构结构的实际需要补充了后端中立的算子实现,其余部分复用已有的 ATen 底层算子与融合算子。补齐后的实现对所有接入 FlagGems 的芯片同时生效,而非每款芯片各自重写。各芯片实际启用的算子集合以模型卡说明为准。
4. 统一 AI 编译器 FlagTree
FlagTree 是 FlagOS 面向多 AI 芯片后端的统一编译器,基于 Triton 深度定制,可将 GLM-5.3-Flash 的核心算子编译为平头哥、英伟达、摩尔线程、华为昇腾、海光、沐曦、清微智能、昆仑芯、曦望等多个 AI 芯片后端可识别的指令,解决不同芯片编译器生态割裂的问题。各芯片编译能力的逐家打通在模型发布前已完成,是发布当日即可覆盖 9 款芯片的前置条件。
5. 模型跨芯迁移发布工具 FlagRelease
依托 FlagOS 全栈技术能力,FlagRelease 已完成 GLM-5.3-Flash 在多种芯片上的模型迁移、精度对齐与版本发布,覆盖 HuggingFace、魔搭等开源社区平台。开发者可直接下载使用,无需自行迁移。截至 2026 年 8 月,FlagRelease 已发布覆盖 10+ 家芯片厂商、12+ 款硬件、80+ 个开源模型实例的跨芯适配版本。
四、开源共建:FlagOS 持续做开发者的“跨芯适配后盾”
当下,“异构算力协同、大模型普惠落地”已成为全球开源开发者社区的核心热点,打破硬件生态隔离、让大模型在不同算力平台高效低成本运行,是无数开发者的核心诉求。FlagOS 从诞生之初就将开源开放、众智共建刻入技术基因,始终以开发者为中心,通过全栈开源的统一系统软件栈,把复杂的“M×N”硬件适配问题降维为“M+N”,做每一位开发者最可靠的跨芯适配后盾。
全栈开源无保留,把技术主动权交给开发者
目前,FlagOS 已形成完整的开源技术体系,所有核心组件均已开源在 GitHub,同时开放了数十款最新的主流基础大模型、十多款 AI 芯片的适配方案与最佳实践:
-
四大核心技术库:FlagGems 通用大模型算子库、FlagTree 统一 AI 编译器、FlagScale 训练推理并行框架、FlagCX 统一通信库,覆盖算子开发、编译优化、并行计算、跨芯片通信全链路;
-
三大开源工具平台:FlagRelease 大模型自动迁移发版平台、KernelGen 算子自动生成工具、FlagPerf 多芯片评测工具,提供从模型适配、性能评测到工程落地的一站式工具链;
-
全场景使能生态:vLLM-plugin-FL、SGLang-plugin-FL、Megatron-LM-FL、TransformerEngine-FL 等框架增强组件,以及 FlagOS-Robo 具身智能工具包,覆盖大模型训练、推理、应用全场景。
多路径参与共建
我们为不同技术方向、不同经验层级的开发者设计了低门槛、多路径的共建方式。
-
新手友好型参与: 可在对应仓库提交 Issue 反馈 bug、优化建议,或是补充完善文档、撰写入门教程与最佳实践,也可参与社区技术交流、分享使用经验(社区文档参考:https://docs.flagos.io/en/latest/)
-
深度技术共建: 开发者可直接参与 FlagGems 算子开发与优化(新增算子 / 性能调优 / 新芯片后端支持)、KernelGen 算子生成流程增强、FlagTree 编译器后端扩展等核心模块,与社区核心开发者一起推动技术演进。
-
生态工具贡献: 开发者可基于 FlagOS Skills 开发面向国产芯片的 AI Agent 专业技能,帮助更多开发者通过自然语言完成芯片适配、模型部署等操作。
欢迎来到FlagOS开发社区,这里是一个汇聚了AI开发者、数据科学家、机器学习爱好者以及业界专家的活力平台。我们致力于成为业内领先的Triton技术交流与应用分享的殿堂,为推动人工智能技术的普及与深化应用贡献力量。
更多推荐




所有评论(0)