Qwen3.8-2.4T首日适配9款AI芯片,众智FlagOS释放多元算力的产业价值
阿里巴巴开源超大规模 MoE 模型 Qwen3.8-2.4T-A95B,众智 FlagOS 社区同步完成 Day0 多芯片适配。Qwen3.8-2.4T-A95B 已在平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、燧原等9家 AI 芯片上完成基于 FlagOS 统一开源技术栈的多芯适配、精度对齐与部署验证,针对不同芯片情况提供包括BF16、FP8、INT8等多种精度的版本,开发者可直接获取对应芯片的开箱即用方案。
从今年2月首次开展 MiniCPM4.5-o 模型的多芯片 Day-0 适配,到今天实现 Qwen3.8-2.4T 模型在9款芯片上的 Day-0 适配,FlagOS 已累计完成来自7大头部模型团队、12 款主流开源模型、在多达10款芯片的跨芯 Day-0 适配,向AI芯片与大模型产业验证了:基于统一、开放的系统软件栈,实现前沿模型 “一次开发、多芯快速适配” 已具备规模化落地能力。
本次发布的Qwen3.8-2.4T-A95B 是阿里巴巴开源模型系列中规模最大、能力最强的一代,首次将 Qwen-Max 级别的模型开放出来。主要特性:
-
超大规模 MoE 架构,总参数 2.4T,激活参数 95B,纯文本模型
-
编程、专业工作、科研、长程智能体任务显著提升;支持 reasoning_effort 调节推理深度,preserve_thinking 保留历史推理
-
原生 262,144 tokens,可扩展至 1,010,000;提供 BF16 / FP8 权重,兼容 vLLM、SGLang、TokenSpeed
在 Coding Agent 相关基准测试中,Qwen3.8-Max 相比 Qwen3.7-Max 有明显提升:Terminal Bench 2.1 从 74.5 升至 86.6,SWE-bench Pro 从 60.6 升至 67.7,接近 Opus 4.8(69.2),PaperBench 从 64.8 升至 93.0,并超过 Opus 4.8(80.3)。
本次Qwen3.8-2.4T模型的适配,虽然相比Qwen3.5/Qwen3.6模型主体结构变化有限,但最重要的挑战是模型参数规模比Qwen3.5-397B扩大了6倍。为了让当下已经部署的主流AI芯片能跑起来,我们需要解决一系列的因为参数规模巨大的系统优化问题。为了解决超大规模参数问题,本次FlagOS技术栈新增了面向多款AI芯片的统一 INT8 量化支持,通过FlagOS-Compressor多芯片模型量化工具链,实现了对Qwen3.8的FP8/BF16原生权重到INT8的两条压缩路径,并完成量化推理算子的在多款AI芯片的适配。量化迁移后的权重,在多种AI芯片上评测,与英伟达原生基于CUDA的FP8版本对照, 误差平均分偏差均在对齐区间内,保证了量化+跨芯迁移后的模型质量。基于众智FlagOS建立的从编译器、算子库、多芯片框架统一plugin等技术,FlagOS团队得以快速完成了模型压缩量化、跨芯适配及验证、精度对齐评测、开源版本发布等重要步骤。
一、从 Day-0 适配到规模化验证:打通前沿模型与多元算力的“首日可用”
Qwen3.8-2.4T 的多芯片 Day-0 适配,是 FlagOS 紧跟前沿模型发布节奏、实现新模型“首日多芯可用”的又一次实践。自今年2月首次开展 Day-0 适配以来,FlagOS 技术团队已在6个月内完成10余款头部开源模型、覆盖多达10款 AI 芯片的 Day-0 适配,持续验证了统一技术栈支撑“多模型、多芯片”快速迁移与部署的规模化能力。
这一能力回应了国产 AI 算力产业化落地的两项核心需求:一方面,使云服务与应用生态能够第一时间部署最新模型;另一方面,让既有算力基础设施持续承接模型演进,延长使用周期、释放存量算力价值。
(一)为国产AI算力云服务抢占新模型“首发窗口”
对国内云厂商、智算中心和新兴 Token 算力服务商而言,每一次大模型发布,都意味着一次新的模型迁移与底层适配。用户希望第一时间在各种国产AI算力上使用最新模型,但不同芯片的适配链路相对独立,往往需要重复投入大量工程资源。上线速度因此不仅是技术能力,也直接决定云服务商能否抓住新模型发布后的市场窗口。
这一痛点对中小型 Token 算力服务商尤为突出。由于采购规模和技术资源有限,它们往往难以推动芯片厂商针对单一模型开展专项适配,也难以长期维持完整的底层适配团队,因此更加需要 FlagOS 这样的开源第三方平台提供公共技术支撑。
FlagOS Day-0 适配将新模型从发布到多芯可用的周期压缩至24小时以内,使中小型算力服务商能够基于国产芯片快速上线推理 API 和 MaaS 服务,无需重复投入大量人力进行底层开发。
目前,腾讯云 HAI 社区、超算互联网等多个云平台已将 FlagOS 适配的模型纳入其容器镜像中心。开发者可直接拉取镜像并部署至云端加速卡,快速构建面向自身业务的 MaaS 推理服务。这表明 FlagOS Day-0 适配正在从技术验证进一步走向云服务交付,缩短国产算力从“支持新模型”到“形成可用服务”的最后一公里。
(二)让存量算力持续承接前沿模型:FlagOS释放硬件投资的长期价值
大模型规模持续增长,正在加快 AI 芯片的迭代节奏。对于以多年周期规划和建设的AI算力集群基础设施,能否持续承载最新模型,直接关系到智算中心AI服务器的利用率和产业投资的可持续性。FlagOS 希望通过量化、算子优化和跨芯适配,为来自多个芯片厂商的存量AI算力继续运行前沿模型拓展空间。
以Qwen3.8-2.4T为例,FlagOS-Compressor 已支持 W8A8 量化,将权重和激活由 BF16 压缩至 INT8,显著降低模型的显存占用与访存压力,同时也解决了当下80%以上存量AI算力不能支持FP8的问题。为了让模型在不同代际的国产AI芯片上部署,我们通过FlagOS技术栈进一步针对量化后的权重规模、单卡显存、卡数、内存带宽以及并行通信方案进行全栈优化,让存量的当代和上一代AI算力也有机会继续承载最新的超大规模 MoE 模型。
对智算中心重资产场景而言,这不仅是延长设备服役周期的问题,更关系到算力投资的长期回报。通过量化与系统软件优化弥补部分硬件代际差距,可以提高存量设备利用率,缓解因模型快速演进带来的硬件更新压力。其目标并非让旧硬件获得与新一代硬件相同的性能,也不是无条件延长所有设备的生命周期,而是在部署条件、模型精度和性能表现均可验证的前提下,为国产算力持续承接前沿模型提供可持续经济的选择。
二、开发者速用指南
FlagOS 为 Qwen3.8-2.4T 提供了统一支持多种 AI 芯片的推理插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL 两种推理框架插件。目前在 FlagOS 推理插件的支持下,平头哥、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、英伟达、燧原等芯片已经通过不同的推理框架插件方式完成 Qwen3.8-2.4T 的推理部署及评测验证,业务代码与标准调用接口无需修改,环境依赖、模型路径与启动参数按各芯片模型卡配置。
使用源码安装部署,可参考以下官方文档:
-
vLLM-plugin-FL:
-
GitHub:https://github.com/flagos-ai/vllm-plugin-FL/blob/main/README.md
-
GitCode:https://gitcode.com/flagos-ai/vllm-plugin-FL/blob/main/README.md
-
-
SGLang-plugin-FL:
-
GitHub:https://github.com/flagos-ai/sglang-plugin-FL/blob/main/README.md
-
GitCode:https://gitcode.com/flagos-ai/sglang-plugin-FL/blob/main/README.md
-
方式一:FlagOS 安装部署
快速安装(以 vLLM 为例)
以平头哥平台的验证为例。其他芯片的运行时版本、插件分支、FlagGems/FlagTree 提交以及是否需要 FlagCX,请以对应芯片的模型卡和 vLLM-plugin-FL / SGLang-plugin-FL 仓库 README 为准。使用 SGLang 请替换为 sglang-plugin-FL 的安装步骤。
运行推理
以下为平头哥平台 INT8 版本的示例,模型路径、tensor_parallel_size、max_num_batched_tokens、max_num_seqs 等参数需按实际芯片型号、卡数与服务配置调整,各芯片的推荐取值见对应模型卡。
方式二:模型镜像直接下载
用户也可以直接拉取在 FlagRelease 上发布的迁移后的模型文件、代码和镜像,开箱即用、无需迁移。下表列出已在 FlagRelease 上线的适配版本。
魔搭平台
|
芯片 |
精度 |
模型 |
下载链接 |
|---|---|---|---|
|
平头哥 |
INT8 |
Qwen3.8-2.4T-A95B |
https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-INT8-zhenwu-FlagOS |
|
英伟达 |
FP8 |
https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-FP8-nvidia-FlagOS |
|
|
英伟达 |
INT8 |
https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-INT8-nvidia-FlagOS |
|
|
摩尔线程 |
FP8 |
https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-FP8-mthreads-FlagOS |
|
|
沐曦 |
INT8 |
https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-INT8-metax-FlagOS |
|
|
海光 |
INT8 |
https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-INT8-hygon-FlagOS |
|
|
昆仑芯 |
INT8 |
https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-INT8-kunlunxin-FlagOS |
|
|
华为昇腾 |
INT8 |
https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-INT8-ascend-FlagOS |
|
|
清微智能 |
INT8 |
https://modelscope.cn/models/FlagRelease/Qwen3.8-2.4T-A95B-INT8-tsingmicro-FlagOS |
|
|
燧原 |
FP8 |
HuggingFace 平台
|
芯片 |
精度 |
模型 |
下载链接 |
|---|---|---|---|
|
平头哥 |
INT8 |
Qwen3.8-2.4T-A95B |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-INT8-zhenwu-FlagOS |
|
英伟达 |
FP8 |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-FP8-nvidia-FlagOS |
|
|
英伟达 |
INT8 |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-INT8-nvidia-FlagOS |
|
|
摩尔线程 |
FP8 |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-FP8-mthreads-FlagOS |
|
|
沐曦 |
INT8 |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-INT8-metax-FlagOS |
|
|
海光 |
INT8 |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-INT8-hygon-FlagOS |
|
|
昆仑芯 |
INT8 |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-INT8-kunlunxin-FlagOS |
|
|
华为昇腾 |
INT8 |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-INT8-ascend-FlagOS |
|
|
清微智能 |
INT8 |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-INT8-tsingmicro-FlagOS |
|
|
燧原 |
FP8 |
https://huggingface.co/FlagRelease/Qwen3.8-2.4T-A95B-FP8-enflame-FlagOS |
三、开发者体验
1. 零改码适配
无论是模型原有接口、vLLM 推理引擎使用逻辑,还是开发者的日常调用代码,均无需做任何修改。FlagOS 通过统一vLLM的多芯片插件(vLLM-plugin-fl),统一实现算子从CUDA到基于Triton语言的FlagGems算子库的替换,并实现适配。开发者专注业务开发即可,无需重新学习硬件相关开发知识,大幅降低迁移与部署门槛。
2. 核心能力与原生版本对齐
经 GPQA_Diamond、 MUSR等权威评测集验证,FlagOS 适配后的 Qwen3.8-2.4T-A95B,在 Agentic Coding 能力、复杂推理等核心能力上,与 CUDA 原生版本对齐,可放心应用于代码生成、日志分析、Bug 排查、复杂文档编辑等生产场景,无需担心适配导致业务效果折损。
与Qwen3.8-2.4T-A95B原生评测数据对比:

注:本表为阶段性评测结果。
3. 开箱即用部署
FlagRelease 直接提供了多芯片版本的 Qwen3.8-2.4T-A95B-FlagOS 模型版本和配套镜像,其中已预置 FlagGems 算子库、FlagTree 编译器等组件,加载模型时底层优化自动生效,开发者无需添加 FlagOS 初始化代码,也无需自行迁移。若不使用 FlagRelease 镜像而采用源码方式部署,则需按前文步骤自行安装 vLLM-plugin-FL 与 FlagGems。
四、大模型核心基座:FlagOS 五大技术支撑,实现极速跨芯适配
包括 Qwen3.8-2.4T 在内的多款模型跨芯适配,依托的是FlagOS 2.1 统一多芯片系统软件栈的全链路能力。从算子层、编译层、框架层到工具层,全链路为大模型跨芯适配提供技术支撑。

1. 统一多芯片推理框架插件
FlagOS 为主流推理框架打造了统一的多芯片插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL,基于 FlagOS 统一多芯片后端开发,在不改变原生接口与用户使用习惯的前提下,实现 Qwen3.8-2.4T 的多芯片推理部署。本次 Qwen3.8-2.4T 适配中,两款插件已在平头哥、摩尔线程、海光、沐曦、昆仑芯、华为昇腾、清微智能、英伟达、等芯片上完成功能跑通与部署验证,精度对齐进度以评测章节的表格为准。插件针对 MoE 模型的专家调度、张量并行、流水线并行等关键环节进行了优化,各芯片支持的框架版本与并行配置请参考对应模型卡。用户可根据业务场景选择 vLLM 或 SGLang。
2. 多芯片量化压缩工具 FlagOS-Compress
FlagOS-Compressor 是 FlagOS 面向大模型压缩与高效部署的模型优化工具,聚焦模型量化等压缩技术。本次针对Qwen3.8-2.4T模型,通过量化降低模型权重、激活等数据的存储与计算开销,延续 FlagOS “统一软件栈 + 多芯片适配”的整体思路,服务于平头哥、华为、海光、英伟达等AI 芯片平台上的高效部署。
3. 高性能算子库 FlagGems
FlagGems 是 FlagOS 核心的高性能通用大模型算子库,基于 Triton 语言实现。本次针对 Qwen3.8-2.4T 推理链路启用并适配的核心算子包括 MoE 专家调度(fused_experts_impl)、Attention 计算,以及本轮新增的 INT8 量化推理算子(scaled_int8_quant、triton_scaled_mm)。算子库当前支持英伟达、摩尔线程、沐曦、清微智能、天数等多家 AI 芯片,各芯片实际启用的算子集合以模型卡说明为准。
4. 统一 AI 编译器 FlagTree
FlagTree 是 FlagOS 面向多 AI 芯片后端的统一编译器,基于 Triton 深度定制,可将 Qwen3.8-2.4T 的核心算子编译为平头哥、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、天数智芯、英伟达、清微智能、燧原等多个 AI 芯片后端可识别的指令,解决不同芯片编译器生态割裂的问题。
5. 模型跨芯迁移发布工具 FlagRelease
依托 FlagOS 全栈技术能力,FlagRelease 已完成 Qwen3.8-2.4T 在多种芯片上的模型迁移、精度对齐与版本发布,覆盖 HuggingFace、魔搭等开源社区平台。开发者可直接下载使用,无需自行迁移。截至 2026 年 8 月,FlagRelease 已发布覆盖 10+ 家芯片厂商、12+ 款硬件、80+ 个开源模型实例的跨芯适配版本。
五、开源共建:FlagOS 持续做开发者的"跨芯适配后盾"
当下,"异构算力协同、大模型普惠落地"已成为全球开源开发者社区的核心热点,打破硬件生态隔离、让大模型在不同算力平台高效低成本运行,是无数开发者的核心诉求。FlagOS 从诞生之初就将开源开放、众智共建刻入技术基因,始终以开发者为中心,通过全栈开源的统一系统软件栈,把复杂的"M×N"硬件适配问题降维为"M+N",做每一位开发者最可靠的跨芯适配后盾。
全栈开源无保留,把技术主动权交给开发者
目前,FlagOS 已形成完整的开源技术体系,所有核心组件均已开源在 GitHub,同时开放了数十款最新的主流基础大模型、十多款 AI 芯片的适配方案与最佳实践:
-
四大核心技术库: FlagGems 通用大模型算子库、FlagTree 统一 AI 编译器、FlagScale 训练推理并行框架、FlagCX 统一通信库,覆盖算子开发、编译优化、并行计算、跨芯片通信全链路;
-
三大开源工具平台: FlagRelease 大模型自动迁移发版平台、KernelGen 算子自动生成工具、FlagPerf 多芯片评测工具,提供从模型适配、性能评测到工程落地的一站式工具链;
-
全场景扩展生态: vLLM-plugin-FL、SGLang-plugin-FL、Megatron-LM-FL、TransformerEngine-FL 等框架增强组件,以及 FlagOS-Robo 具身智能工具包,覆盖大模型训练、推理、应用全场景。
多路径参与共建
我们为不同技术方向、不同经验层级的开发者设计了低门槛、多路径的共建方式:
-
新手友好型参与: 可在对应仓库提交 Issue 反馈 bug、优化建议,或是补充完善文档、撰写入门教程与最佳实践,也可参与社区技术交流、分享使用经验;(社区文档参考:https://docs.flagos.io/en/latest/)
-
深度技术共建: 开发者可直接参与 FlagGems 算子开发与优化(新增算子 / 性能调优 / 新芯片后端支持)、KernelGen 算子生成流程增强、FlagTree 编译器后端扩展等核心模块,与社区核心开发者一起推动技术演进。
-
生态工具贡献: 开发者可基于 FlagOS Skills 开发面向国产芯片的 AI Agent 专业技能,帮助更多开发者通过自然语言完成芯片适配、模型部署等操作。
欢迎来到FlagOS开发社区,这里是一个汇聚了AI开发者、数据科学家、机器学习爱好者以及业界专家的活力平台。我们致力于成为业内领先的Triton技术交流与应用分享的殿堂,为推动人工智能技术的普及与深化应用贡献力量。
更多推荐




所有评论(0)