登录社区云,与社区用户共同成长
邀请您加入社区
FlagOS社区同步完成智谱开源多模态MoEt模型GLM-5.3-Flash在9款芯片的Day0适配,当前模型镜像已发布魔搭和Hugging Face,开发者无需修改代码即可跨芯部署!
FlagOS 为主流推理框架打造了统一的多芯片插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL,基于 FlagOS 统一多芯片后端开发,在不改变原生接口与用户使用习惯的前提下,实现 Qwen3.8-Flash-Next 的多芯片推理部署。其他芯片的运行时版本、插件分支、FlagGems/FlagTree 提交以及是否需要 FlagCX,请以对应芯片的模型卡和 vLLM
近两年来,AI 算力需求持续膨胀,但硬件生态的碎片化却让开发者头疼。一个在 NVIDIA GPU 上精心调优的算子,往往无法直接在其他主流芯片上高效运行。这种“锁仓”效应,正成为制约 AI 创新的一大瓶颈。 与此同时,编译器技术也迎来了新变革。基于 MLIR 构建的中间表示层,凭借其可移植性和可组合性,正逐步成为主流方向。CUDA Tile IR 与面向多芯片的统一编译框架 FlagTree(Fl
阿里巴巴开源270亿参数视觉语言模型Qwen3.8-27B,并通过众智FlagOS社区完成跨平台适配。该模型已在11款AI芯片(包括平头哥、英伟达、摩尔线程等)和ARM端侧平台完成部署验证,其中摩尔线程支持FP8精度,其余芯片支持BF16。FlagOS技术栈首次实现27B大模型在ARM平台的W4A8低比特量化部署,推理性能显著优于原生方案。模型具备26万token长文本处理能力,支持代码生成、智能
阿里巴巴开源超大规模MoE模型Qwen3.8-2.4T-A95B,该模型总参数达2.4万亿,激活参数95B,是当前开源规模最大、能力最强的模型之一。众智FlagOS社区同步完成该模型在平头哥、英伟达等9家AI芯片上的Day0多芯适配,提供BF16、FP8、INT8等多种精度版本。FlagOS通过统一技术栈实现一次开发、多芯快速适配,已累计完成12款主流开源模型在10款芯片上的跨芯适配。Qwen3.
在FlagOS的统一算子库FlagGems、统一编译器FlagTree及基于FlagScale的多芯片适配支持下,海光、沐曦、华为、摩尔线程(FP8)、昆仑芯、平头哥、天数、英伟达(FP8)、清微、曦望等10款芯片,已经完成 DeepSeek-V4系列模型的跨芯适配及验证。同时,基于 FlagRelease 直接提供了多芯片版本的 DeepSeek-V4-FlagOS 模型版本,标准化 Docke