日常模型开发中,我们依赖的常规 Python 调试手段,仅能覆盖上层代码逻辑,根本无法穿透到设备侧,获取真实、细粒度的运行时数据。

一方面,性能调优无依据:无法精准定位 Kernel 内部各操作的耗时节点,优化只能靠经验、靠猜测,低效且盲目;

另一方面,数值 bug 难溯源:算子计算出现数值异常时,无法追溯中间计算步骤,排查耗时翻倍,问题反复复现。

更棘手的是,各芯片厂商设备接口不统一、功能支持参差不齐,不同设备调试、分析工具碎片化严重。调试算子,某种程度上比写算子还痛苦。

一套通用、统一、可落地的设备侧 Profiling&Debugging 方案,成为开发者的迫切刚需。

三个月,我们试图打开这个黑盒

过去三个月,我们在 FlagOS 的核心组件 FlagTree 进行了一次系统性的尝试:设计并实现一套统一的 Profiler & Debugger 原型工具,目标是让设备侧算子从“不可见”变为“可观测”。

我们的思路很直接:

Profiler——让耗时“颗粒度”细到 kernel 内部。 不再满足于“算子整体跑了多久”,而是深入 kernel 内部,拆解每一段操作的执行时间。访存、计算、同步……哪一步是瓶颈,一目了然。

Debugger——让数值异常“定位”到具体步骤。 不再靠 print 猜测,而是在中间计算过程中设置观测点,精确捕获每一步的数值状态。溢出、截断、异常值——在哪一步发生的,怎么发生的,看得清清楚楚。

统一框架——适配不同芯片厂商的设备接口。 面对各厂商接口和功能差异,我们设计了一套抽象层,尽可能屏蔽底层差异,让同一套工具能在不同设备上运行。这很难,但我们迈出了第一步。

这次直播,我们会聊什么?

本次直播将完整分享近三个月在 FlagOS 的核心组件 FlagTree 进行 Profiler & Debugger 开发的设计思路与原型实现,并带来工具初步版本的现场演示。

你将看到:

痛点深度拆解:详解算子开发中,设备侧性能分析、数值调试的核心卡点与行业现状

原型设计全公开:分享三个月攻坚成果,拆解 Profiler&Debugger 工具整体架构、设计理念与适配逻辑

核心能力解读:揭秘细粒度 Profiling 耗时统计、全流程 Debug 数值溯源两大核心功能

现场实操演示:工具初版功能实景演示,直观展示如何快速定位 Kernel 耗时、排查数值异常

直播时间:

2026年8月6日晚 19:00-20:00

直播平台:

  • 智源 FlagOpen 视频号

  • FlagOS 智算系统软件栈CSDN-Devpress

  • FlagOS 小红书

直播福利:

直播期间参与抽奖,将有机会获得 FlagOS 独家定制周边!

欢迎扫描下方二维码,加入【FlagOS 技术交流群】,获取一手 PPT 及学习资料。

图片

如果你正在做算子开发,或者对 AI 系统软件栈的可观测性感兴趣,

这次直播值得标记日历。

算子调试这件事,不该再靠猜了。

FlagOS 的核心组件FlagTree ,

让每一步都可观测。

Logo

欢迎来到FlagOS开发社区,这里是一个汇聚了AI开发者、数据科学家、机器学习爱好者以及业界专家的活力平台。我们致力于成为业内领先的Triton技术交流与应用分享的殿堂,为推动人工智能技术的普及与深化应用贡献力量。

更多推荐