FlagOS 技术直播预告 | 别再盲目调优算子!细粒度设备侧 Profiling 实战来了
日常模型开发中,我们依赖的常规 Python 调试手段,仅能覆盖上层代码逻辑,根本无法穿透到设备侧,获取真实、细粒度的运行时数据。
一方面,性能调优无依据:无法精准定位 Kernel 内部各操作的耗时节点,优化只能靠经验、靠猜测,低效且盲目;
另一方面,数值 bug 难溯源:算子计算出现数值异常时,无法追溯中间计算步骤,排查耗时翻倍,问题反复复现。
更棘手的是,各芯片厂商设备接口不统一、功能支持参差不齐,不同设备调试、分析工具碎片化严重。调试算子,某种程度上比写算子还痛苦。
一套通用、统一、可落地的设备侧 Profiling&Debugging 方案,成为开发者的迫切刚需。
三个月,我们试图打开这个黑盒
过去三个月,我们在 FlagOS 的核心组件 FlagTree 进行了一次系统性的尝试:设计并实现一套统一的 Profiler & Debugger 原型工具,目标是让设备侧算子从“不可见”变为“可观测”。
我们的思路很直接:
Profiler——让耗时“颗粒度”细到 kernel 内部。 不再满足于“算子整体跑了多久”,而是深入 kernel 内部,拆解每一段操作的执行时间。访存、计算、同步……哪一步是瓶颈,一目了然。
Debugger——让数值异常“定位”到具体步骤。 不再靠 print 猜测,而是在中间计算过程中设置观测点,精确捕获每一步的数值状态。溢出、截断、异常值——在哪一步发生的,怎么发生的,看得清清楚楚。
统一框架——适配不同芯片厂商的设备接口。 面对各厂商接口和功能差异,我们设计了一套抽象层,尽可能屏蔽底层差异,让同一套工具能在不同设备上运行。这很难,但我们迈出了第一步。
这次直播,我们会聊什么?
本次直播将完整分享近三个月在 FlagOS 的核心组件 FlagTree 进行 Profiler & Debugger 开发的设计思路与原型实现,并带来工具初步版本的现场演示。
你将看到:
痛点深度拆解:详解算子开发中,设备侧性能分析、数值调试的核心卡点与行业现状
原型设计全公开:分享三个月攻坚成果,拆解 Profiler&Debugger 工具整体架构、设计理念与适配逻辑
核心能力解读:揭秘细粒度 Profiling 耗时统计、全流程 Debug 数值溯源两大核心功能
现场实操演示:工具初版功能实景演示,直观展示如何快速定位 Kernel 耗时、排查数值异常
直播时间:
2026年8月6日晚 19:00-20:00
直播平台:
-
智源 FlagOpen 视频号
-
FlagOS 智算系统软件栈CSDN-Devpress
-
FlagOS 小红书
直播福利:
直播期间参与抽奖,将有机会获得 FlagOS 独家定制周边!
欢迎扫描下方二维码,加入【FlagOS 技术交流群】,获取一手 PPT 及学习资料。

如果你正在做算子开发,或者对 AI 系统软件栈的可观测性感兴趣,
这次直播值得标记日历。
算子调试这件事,不该再靠猜了。
FlagOS 的核心组件FlagTree ,
让每一步都可观测。
欢迎来到FlagOS开发社区,这里是一个汇聚了AI开发者、数据科学家、机器学习爱好者以及业界专家的活力平台。我们致力于成为业内领先的Triton技术交流与应用分享的殿堂,为推动人工智能技术的普及与深化应用贡献力量。
更多推荐




所有评论(0)