全芯片峰值 vs 单核心性能
CUDA 核心(标量)
• FP32 67 TFLOPS(全芯片 18,432 核心合计)→ 单核心 ≈ 3.6 GFLOPS
• FP64 34 TFLOPS(全芯片合计)→ 单核心 ≈ 1.8 GFLOPS
Tensor Core(矩阵)
• FP16 / BF16 1.2 PFLOPS(全芯片 576 核心合计)→ 单核心 ≈ 2 TFLOPS
• FP8 2.4 PFLOPS(全芯片合计)→ 单核心 ≈ 4.2 TFLOPS
• INT8 2.4 POPS(全芯片合计)→ 单核心 ≈ 4.2 TOPS
💡 单位换算:1 PFLOPS = 1000 TFLOPS · 1 TFLOPS = 1000 GFLOPS
🔑 关键理解:图表中所有性能数字都是 「全芯片峰值」,即所有核心同时工作时的总吞吐量。
TFLOPS = 每秒 10¹² 次浮点运算(万亿次)PFLOPS = 每秒 10¹⁵ 次浮点运算(千万亿次)POPS = 每秒 10¹⁵ 次整数运算(千万亿次)
主图:完整的 GPU 架构,从 CPU 到显存的完整数据流。
辅助图 1:SM 内部结构,看清 Tensor Core 的位置。
辅助图 2:存储层次金字塔,理解延迟与容量的权衡。
辅助图 3:AI 推理数据流,关注 HBM3 → L2 → SM 路径。
辅助图 4:⭐ 性能对应关系 — CUDA核心 跑 FP32/FP64,Tensor Core 跑 FP16/FP8/INT8;
图中数字是 全芯片峰值,单核心性能已换算标注。