本文へ移動
cccskills
無料GitHub で公開

kernel-runtime-analysis

诊断 GPU 算子、融合、编译和运行时提交的性能问题。用于判断重读、重算、启动或同步是否位于请求关键路径。

インストール方法を見る

含まれるファイル(1)

  • SKILL.md1.2 KB

SKILL.md(原文)

インストールする前に、エージェントに与えられる指示の中身を確認できます。

算子与运行时分析

适用:有算子 trace、kernel 计时或编译方案,想解释局部优化能否缩短完整请求。依据 manuscripts/05-算子与运行时.md 第 5.1—5.6 节。

  1. 记录张量形状、精度、布局、tile、寄存器或片上存储占用、有效带宽和 kernel 启动次数;确认优化前后工作量是否相同。
  2. 追踪数据被读写和复用的次数。融合/预计算节省的外部访存,要与额外片上空间、占用率下降、重算或准备开销比较。
  3. 按依赖检查分块、流水、事件与缓冲区复用;数据未就绪前不可读取,消费者完成前不可释放。
  4. 在完整请求 trace 中定位该阶段的关键路径占比,区分可重叠的传输与必须等待的同步。用相同输入和预热条件复测总时间。

输出瓶颈证据、预期节省与实际端到端变化。单个 kernel 加速而任务无明显变化时,先检查是否被其他阶段遮蔽,不直接归因于测量错误。

レビュー

まだレビューはありません。使ってみた感想をお寄せください。

同じリポジトリのスキル

概要と使いどころ

为给定模型负载比较加速器的容量、有效计算、内存带宽、功耗与成本。用于硬件选型或解释标称峰值与实测差异。

日本語の概要は準備中です。原文の説明を表示しています。

bojieli/ai-infra-book6,2262026年10月1日 更新

规划 Agent 模型调用与工具环境的创建、驻留、释放和恢复。用于并发容量、沙箱成本与完整任务时延分析。

日本語の概要は準備中です。原文の説明を表示しています。

bojieli/ai-infra-book6,2262026年10月1日 更新

估算多节点训练或推理的跨服务器流量、网络瓶颈与同步等待。用于比较拓扑、通信路径和网络优化收益。

日本語の概要は準備中です。原文の説明を表示しています。

bojieli/ai-infra-book6,2262026年10月1日 更新

比较推理副本、prefill/decode 分离、专家放置与共享 KV 的跨实例方案。用于容量规划、路由、扩缩容和故障恢复。

日本語の概要は準備中です。原文の説明を表示しています。

bojieli/ai-infra-book6,2262026年10月1日 更新

比较模型或任务放在端侧、边缘或云端时的交互延迟、网络传输、能耗与恢复。用于多模态和实时 Agent 部署。

日本語の概要は準備中です。原文の説明を表示しています。

bojieli/ai-infra-book6,2262026年10月1日 更新

为单实例推理服务比较批处理、请求调度、KV 缓存、卸载和推测解码。用于容量、吞吐、延迟和每合格请求成本的取舍。

日本語の概要は準備中です。原文の説明を表示しています。

bojieli/ai-infra-book6,2262026年10月1日 更新

bojieli のスキルをすべて見る

このスキルの問題を報告する