为给定模型负载比较加速器的容量、有效计算、内存带宽、功耗与成本。用于硬件选型或解释标称峰值与实测差异。
日本語の概要は準備中です。原文の説明を表示しています。
诊断 GPU 算子、融合、编译和运行时提交的性能问题。用于判断重读、重算、启动或同步是否位于请求关键路径。
インストールする前に、エージェントに与えられる指示の中身を確認できます。
适用:有算子 trace、kernel 计时或编译方案,想解释局部优化能否缩短完整请求。依据 manuscripts/05-算子与运行时.md 第 5.1—5.6 节。
输出瓶颈证据、预期节省与实际端到端变化。单个 kernel 加速而任务无明显变化时,先检查是否被其他阶段遮蔽,不直接归因于测量错误。
まだレビューはありません。使ってみた感想をお寄せください。
概要と使いどころ
为给定模型负载比较加速器的容量、有效计算、内存带宽、功耗与成本。用于硬件选型或解释标称峰值与实测差异。
日本語の概要は準備中です。原文の説明を表示しています。
规划 Agent 模型调用与工具环境的创建、驻留、释放和恢复。用于并发容量、沙箱成本与完整任务时延分析。
日本語の概要は準備中です。原文の説明を表示しています。
估算多节点训练或推理的跨服务器流量、网络瓶颈与同步等待。用于比较拓扑、通信路径和网络优化收益。
日本語の概要は準備中です。原文の説明を表示しています。
比较推理副本、prefill/decode 分离、专家放置与共享 KV 的跨实例方案。用于容量规划、路由、扩缩容和故障恢复。
日本語の概要は準備中です。原文の説明を表示しています。
比较模型或任务放在端侧、边缘或云端时的交互延迟、网络传输、能耗与恢复。用于多模态和实时 Agent 部署。
日本語の概要は準備中です。原文の説明を表示しています。
为单实例推理服务比较批处理、请求调度、KV 缓存、卸载和推测解码。用于容量、吞吐、延迟和每合格请求成本的取舍。
日本語の概要は準備中です。原文の説明を表示しています。