Tensor Core 完全解读
一句话定义:GPU 里专门做矩阵乘加的硬件单元,一个时钟周期算一整块小矩阵,比普通 CUDA Core 快一个数量级。
为什么关键:神经网络计算(全连接层、卷积层)本质全是矩阵乘法(GEMM)——谁矩阵乘得快,谁训练/推理就快。
一、CUDA Core vs Tensor Core
| 对比维度 | CUDA Core | Tensor Core |
|---|---|---|
| 干什么 | 通用标量/向量运算,一次算一两个数的乘加 | 一次算一整块小矩阵的乘加(如 4×4 × 4×4) |
| 类比 | 全能工人,啥活都能干 | 矩阵乘专用流水线,单一活但暴快 |
| 吞吐 | 基准线 | 矩阵运算快 8~16 倍 |
| 灵活性 | 高(任意指令) | 低(只干矩阵乘加) |
二、怎么工作(数学原理)
Tensor Core 执行的是 矩阵乘加(MMA) 操作:
D = A × B + C
- 输入:低精度(FP16、BF16、INT8、FP8)—— 省带宽、省计算
- 累加:高精度(FP32)—— 保证梯度/结果不溢出
👉 这就是 混合精度(Mixed Precision) 的核心:输入砍精度省算力,累加留高精度保质量,做到又快又不怎么掉点。
三、串起来
- TensorRT 优化:核心工作就是尽量把所有算子映射到 Tensor Core 上执行,避开慢的 CUDA Core。
- FP16/INT8 推理快:正是因为 Tensor Core 专门为这些低精度格式做了硬件加速。
- 架构代际升级:Volta → Turing → Ampere → Ada/Hopper,每一代叠的其实就是 Tensor Core 新增支持的数据精度(FP16 → INT8 → TF32/稀疏 → FP8)。
四、一句话终极记忆
Tensor Core = 吃矩阵乘加这碗饭的专用流水线,AI 芯片的命根子。
评论
0