用 tegrastats 绘制实时性能曲线 + Roofline Model 瓶颈定位实战 用 tegrastats 绘制实时性能曲线 + Roofline Model 瓶颈定位实战 目标:将 的实时监控数据转化为可视化的性能曲线,并与 Roofline Model 理论天花板对比,精确定位当前推理任务的瓶颈是 计算受限、内存带宽受限,还是 功耗/温度降频受限。 --- 📐 第一步: zTgx 4 0 0 CUDAGPU训练
tegrastats 真实输出逐字段拆解 tegrastats 真实输出逐字段拆解(Orin Nano 实测) 测试设备:NVIDIA Jetson Orin Nano 8GB 系统状态:空闲轻载(未运行推理任务) 采集命令: 采样时间:2026-07-12 09:57:53 --- 📊 原始输出全文 --- 🔍 逐 zTgx 0 0 0 CUDAGPU训练
Jetson 开发环境验证与性能调优完整 Checklist Jetson 开发环境验证与性能调优完整 Checklist 适用设备:NVIDIA Jetson Nano / Xavier NX / Orin NX / Orin Nano Super 目标:新机/重置后,10 分钟内完成环境验证、性能锁频、监控部署,确保后续 Benchmark 结果可 zTgx 0 0 0 CUDAGPU训练
Roofline Model(屋顶线模型) Roofline Model(屋顶线模型) --- 1. 核心定义(一句话版) Roofline Model 是一个性能可视化分析模型,用于在给定硬件平台和计算核心上,快速定位程序性能瓶颈是“计算受限”还是“内存受限”,并指导优化方向。 它由 UC Berkeley 在 2009 年提出,是高性能计 zTgx 0 0 0 CUDAGPU职场
ONNX 格式 ONNX 文件本质上是一个 Protobuf 序列化的模型描述,包含两大部分:计算图结构 和 权重数据。 .onnx 里面还有什么: 1. 完整的计算图(graph)——所有节点(Conv、BatchNorm、Relu、Add 等算子)、它们的连接关系、执行顺序。也就是网络的"骨架"。 2. 输入/ zTgx 0 0 0 GPU训练大模型
trtexec 基本命令使用 trtexec 远不止转 engine,它其实是 TensorRT 的"瑞士军刀",主要有三大类功能:构建、性能测试、调试分析。 1. 构建引擎 除了基本转换,还有很多常用构建选项: 2. 性能基准测试(benchmark)——这可能是它最常用的功能 不保存引擎也可以直接测速,或者加载已有引擎测: zTgx 1 0 0 CUDAGPU推理
GEMM GEMM = General Matrix Multiply(通用矩阵乘法),数学上就是: (通常简化为 ) --- 为什么 GEMM 无处不在? 深度学习的所有核心运算,最终都能转化成 GEMM: | 网络层 | 怎么变成 GEMM | | :--- | :--- | | 全连接层(FC) | 本 zTgx 0 0 0 CUDAGPU训练
TOPS & FLOPS TOPS 是什么 TOPS = Tera Operations Per Second,每秒万亿次运算,衡量 AI 算力的单位。 FLOPS = Floating-Point Operations Per Second(每秒浮点运算次数),也是衡量计算速度的单位,但专门针对浮点数(小数)运算。 训练 zTgx 0 0 0 GPU推理大模型
PTX 入门:读懂 NVIDIA GPU 的虚拟汇编 PTX 是 NVIDIA GPU 的虚拟 ISA,介于 LLVM IR 和真正的 GPU 机器码 SASS 之间。它跟 x86 完全不同——指令格式统一、寄存器无限、地址空间显式。本文讲清楚 PTX 指令格式、state space(地址空间)、常用指令族,最后用一段 5 行的 hello_kernel PTX 逐行拆解。 zTgx 13 0 0 专题compilerptx
cuda-oxide:hello-constant 拆解 11(完结)——GPU 执行 + 结果回传 拆 hello-constant 系列最终站。cuLaunchKernel 返回后 GPU 接管,256 个线程并行执行 SASS。本文讲清楚 SM 调度 + warp 锁步、printf buffer 的延迟 flush 机制、benign race(良性竞争)、cuStreamSynchronize + cuMemcpyDtoH 的回传链路,以及为什么 thread xxx: 42 在 Output: 42 之前出现。 zTgx 0 0 0 专题cuda-oxidecuda-driver