用 tegrastats 绘制实时性能曲线 + Roofline Model 瓶颈定位实战 用 tegrastats 绘制实时性能曲线 + Roofline Model 瓶颈定位实战 目标:将 的实时监控数据转化为可视化的性能曲线,并与 Roofline Model 理论天花板对比,精确定位当前推理任务的瓶颈是 计算受限、内存带宽受限,还是 功耗/温度降频受限。 --- 📐 第一步: zTgx 4 0 0 CUDAGPU训练
tegrastats 真实输出逐字段拆解 tegrastats 真实输出逐字段拆解(Orin Nano 实测) 测试设备:NVIDIA Jetson Orin Nano 8GB 系统状态:空闲轻载(未运行推理任务) 采集命令: 采样时间:2026-07-12 09:57:53 --- 📊 原始输出全文 --- 🔍 逐 zTgx 0 0 0 CUDAGPU训练
Jetson 开发环境验证与性能调优完整 Checklist Jetson 开发环境验证与性能调优完整 Checklist 适用设备:NVIDIA Jetson Nano / Xavier NX / Orin NX / Orin Nano Super 目标:新机/重置后,10 分钟内完成环境验证、性能锁频、监控部署,确保后续 Benchmark 结果可 zTgx 0 0 0 CUDAGPU训练
Roofline Model(屋顶线模型) Roofline Model(屋顶线模型) --- 1. 核心定义(一句话版) Roofline Model 是一个性能可视化分析模型,用于在给定硬件平台和计算核心上,快速定位程序性能瓶颈是“计算受限”还是“内存受限”,并指导优化方向。 它由 UC Berkeley 在 2009 年提出,是高性能计 zTgx 0 0 0 CUDAGPU职场
trtexec 基本命令使用 trtexec 远不止转 engine,它其实是 TensorRT 的"瑞士军刀",主要有三大类功能:构建、性能测试、调试分析。 1. 构建引擎 除了基本转换,还有很多常用构建选项: 2. 性能基准测试(benchmark)——这可能是它最常用的功能 不保存引擎也可以直接测速,或者加载已有引擎测: zTgx 1 0 0 CUDAGPU推理
GEMM GEMM = General Matrix Multiply(通用矩阵乘法),数学上就是: (通常简化为 ) --- 为什么 GEMM 无处不在? 深度学习的所有核心运算,最终都能转化成 GEMM: | 网络层 | 怎么变成 GEMM | | :--- | :--- | | 全连接层(FC) | 本 zTgx 0 0 0 CUDAGPU训练
PTX 入门:读懂 NVIDIA GPU 的虚拟汇编 PTX 是 NVIDIA GPU 的虚拟 ISA,介于 LLVM IR 和真正的 GPU 机器码 SASS 之间。它跟 x86 完全不同——指令格式统一、寄存器无限、地址空间显式。本文讲清楚 PTX 指令格式、state space(地址空间)、常用指令族,最后用一段 5 行的 hello_kernel PTX 逐行拆解。 zTgx 13 0 0 专题compilerptx
从 Rust 写 inline PTX 模板 会读 PTX 之后,下一步是从 Rust 里写自己的 PTX——这是实现自定义 GPU intrinsic 的必备技能。本文讲清楚 inline asm 的'模板 + 约束串'两段对应关系、临时寄存器作用域、谓词输出 selp 套路、format! 动态生成的陷阱,以及一个'读 shared memory 比对'的完整合成例子。 zTgx 0 0 0 专题compilerptx
cuda-oxide:hello-constant 全流程拆解——导读 用最简单的 hello-constant example,把 cuda-oxide 从一条 cargo 命令到 GPU 输出 42 之间发生的所有事,拆成 11 步逐站讲透。这是开篇——讲清楚我们要拆什么、为什么挑这个例子、整条路线长什么样。 zTgx 0 0 0 专题cuda-oxiderust
cuda-oxide:开篇 用 Rust 直接写 CUDA kernel,编译成 PTX 跑在 GPU 上——cuda-oxide 是什么、为什么值得研究、这个系列要讲什么。 zTgx 1 0 0 专题cuda-oxiderust