用 tegrastats 绘制实时性能曲线 + Roofline Model 瓶颈定位实战 用 tegrastats 绘制实时性能曲线 + Roofline Model 瓶颈定位实战 目标:将 的实时监控数据转化为可视化的性能曲线,并与 Roofline Model 理论天花板对比,精确定位当前推理任务的瓶颈是 计算受限、内存带宽受限,还是 功耗/温度降频受限。 --- 📐 第一步: zTgx 4 0 0 CUDAGPU训练
Jetson 开发环境验证与性能调优完整 Checklist Jetson 开发环境验证与性能调优完整 Checklist 适用设备:NVIDIA Jetson Nano / Xavier NX / Orin NX / Orin Nano Super 目标:新机/重置后,10 分钟内完成环境验证、性能锁频、监控部署,确保后续 Benchmark 结果可 zTgx 0 0 0 CUDAGPU训练
ONNX 格式 ONNX 文件本质上是一个 Protobuf 序列化的模型描述,包含两大部分:计算图结构 和 权重数据。 .onnx 里面还有什么: 1. 完整的计算图(graph)——所有节点(Conv、BatchNorm、Relu、Add 等算子)、它们的连接关系、执行顺序。也就是网络的"骨架"。 2. 输入/ zTgx 0 0 0 GPU训练大模型
trtexec 基本命令使用 trtexec 远不止转 engine,它其实是 TensorRT 的"瑞士军刀",主要有三大类功能:构建、性能测试、调试分析。 1. 构建引擎 除了基本转换,还有很多常用构建选项: 2. 性能基准测试(benchmark)——这可能是它最常用的功能 不保存引擎也可以直接测速,或者加载已有引擎测: zTgx 1 0 0 CUDAGPU推理
GEMM GEMM = General Matrix Multiply(通用矩阵乘法),数学上就是: (通常简化为 ) --- 为什么 GEMM 无处不在? 深度学习的所有核心运算,最终都能转化成 GEMM: | 网络层 | 怎么变成 GEMM | | :--- | :--- | | 全连接层(FC) | 本 zTgx 0 0 0 CUDAGPU训练
TOPS & FLOPS TOPS 是什么 TOPS = Tera Operations Per Second,每秒万亿次运算,衡量 AI 算力的单位。 FLOPS = Floating-Point Operations Per Second(每秒浮点运算次数),也是衡量计算速度的单位,但专门针对浮点数(小数)运算。 训练 zTgx 0 0 0 GPU推理大模型