⚙️ GPU 完整架构 NVIDIA H100 · 含 Tensor Core

主图
graph TB subgraph Host["💻 主机 / 系统"] CPU["中央处理器 CPU
PCIe 5.0 x16"] DRAM["系统内存 DRAM
DDR5-6400"] end subgraph GPU["🎮 GPU 芯片"] PCIe["PCIe 5.0 接口
带宽 64 GB/s"] GPC["图形处理集群 GPC
9 个 GPC"] subgraph SM_Cluster["流式多处理器集群 (SM) · 共 144 个"] SM1["SM #1
─────────────
🟦 CUDA 核心 ×128
🔴 Tensor Core ×4
🟩 SFU ×8
🟨 纹理单元 ×8"] SM2["SM #2
─────────────
🟦 CUDA 核心 ×128
🔴 Tensor Core ×4
🟩 SFU ×8
🟨 纹理单元 ×8"] SM3["SM #3
─────────────
🟦 CUDA 核心 ×128
🔴 Tensor Core ×4
🟩 SFU ×8
🟨 纹理单元 ×8"] SM4["SM #4
─────────────
🟦 CUDA 核心 ×128
🔴 Tensor Core ×4
🟩 SFU ×8
🟨 纹理单元 ×8"] end subgraph Cache_Mem["片上缓存 / 内存"] L1["L1 缓存 / 共享内存
128 KB (每 SM)"] L2["L2 统一缓存
96 MB (全局)"] Register["寄存器堆
256 KB (每 SM)"] end subgraph VRAM["显存子系统"] GDDR["HBM3 显存
带宽 1.5 TB/s
容量 80 GB"] MemoryCtrl["内存控制器
5120-bit 位宽"] end end CPU -->|"PCIe 传输"| PCIe DRAM -->|"系统内存"| CPU PCIe -->|"命令 / 数据"| GPC GPC -->|"调度分发"| SM1 GPC -->|"调度分发"| SM2 GPC -->|"调度分发"| SM3 GPC -->|"调度分发"| SM4 SM1 -->|"读写"| L1 SM2 -->|"读写"| L1 SM3 -->|"读写"| L1 SM4 -->|"读写"| L1 L1 -->|"缓存一致性"| L2 L2 -->|"全局共享"| MemoryCtrl MemoryCtrl -->|"访存"| GDDR SM1 -.->|"寄存器"| Register SM2 -.->|"寄存器"| Register SM3 -.->|"寄存器"| Register SM4 -.->|"寄存器"| Register
主机 & 系统 GPU 核心单元 缓存 / 内存 显存子系统 Tensor Core (SM 内部) ➡️ 数据流 · 控制流

🔬 辅助图 1 · SM 内部结构 流式多处理器

放大
graph TB subgraph SM["🔲 流式多处理器 SM (×144)"] CUDA["🟦 CUDA 核心
×128 · 标量运算"] TC["🔴 Tensor Core
×4 · 矩阵乘加"] SFU["🟩 SFU
×8 · sin/cos/log"] Tex["🟨 纹理单元
×8 · 采样/过滤"] L1_local["L1 / 共享内存
128 KB"] Reg_local["寄存器堆
256 KB"] end CUDA --> L1_local TC --> L1_local SFU --> L1_local Tex --> L1_local CUDA -.-> Reg_local TC -.-> Reg_local SFU -.-> Reg_local Tex -.-> Reg_local
计算单元 Tensor Core 存储

🗄️ 辅助图 2 · 存储层次 延迟 · 容量 · 带宽

金字塔
graph LR R["寄存器
256KB/SM
1 周期"] L1C["L1/共享内存
128KB/SM
2 周期"] L2C["L2 缓存
96MB 全局
~50 周期"] H["HBM3 显存
80GB · 1.5TB/s
~500 周期"] R --> L1C L1C --> L2C L2C --> H
⬆️ 越快 ⬇️ 越大 越往上越快 · 越往下越大

🧠 辅助图 3 · AI 推理数据流 LLM 推理路径

AI 视图
graph LR Host["系统内存
模型权重"] PCIe["PCIe 5.0
64 GB/s"] HBM["HBM3 显存
80 GB"] L2["L2 缓存
96 MB"] SM["SM
Tensor Core"] Out["推理结果"] Host -->|"加载"| PCIe PCIe -->|"DMA"| HBM HBM -->|"权重读取"| L2 L2 -->|"缓存命中"| SM SM -->|"矩阵运算"| Out style SM fill:#fde8e8,stroke:#c0392b,stroke-width:2px style Out fill:#e8f4e8,stroke:#2a7a3a,stroke-width:2px
主机/传输 显存/缓存 Tensor Core

⚡ 辅助图 4 · 性能对应关系 哪个核心跑什么精度?全芯片 vs 单核心

性能
graph TB subgraph CUDA["🟦 CUDA 核心 (标量运算)"] C1["FP32: 67 TFLOPS"] C2["FP64: 34 TFLOPS"] C3["全芯片 18,432 个"] C4["单核心 ~3.6 GFLOPS"] end subgraph TC["🔴 Tensor Core (矩阵乘加)"] T1["FP16: 1.2 PFLOPS"] T2["BF16: 1.2 PFLOPS"] T3["FP8: 2.4 PFLOPS"] T4["INT8: 2.4 POPS"] T5["全芯片 576 个"] T6["单核心 ~2 TFLOPS"] end C1 --> C3 T1 --> T5 style CUDA fill:#e3edf5,stroke:#2a5f7a style TC fill:#fde8e8,stroke:#c0392b

📐 性能数据解读

全芯片峰值 vs 单核心性能

CUDA 核心(标量)
FP32 67 TFLOPS(全芯片 18,432 核心合计)→ 单核心 ≈ 3.6 GFLOPS
FP64 34 TFLOPS(全芯片合计)→ 单核心 ≈ 1.8 GFLOPS

Tensor Core(矩阵)
FP16 / BF16 1.2 PFLOPS(全芯片 576 核心合计)→ 单核心 ≈ 2 TFLOPS
FP8 2.4 PFLOPS(全芯片合计)→ 单核心 ≈ 4.2 TFLOPS
INT8 2.4 POPS(全芯片合计)→ 单核心 ≈ 4.2 TOPS

💡 单位换算1 PFLOPS = 1000 TFLOPS · 1 TFLOPS = 1000 GFLOPS
🔑 关键理解:图表中所有性能数字都是 「全芯片峰值」,即所有核心同时工作时的总吞吐量。

📖 GPU 核心概念速查

14 项
Tensor Core AI 核心
集成在 SM 内部的矩阵乘加单元。每 SM 4 个,全芯片 576 个。 支持 FP16/BF16/FP8/INT8 混合精度。
每 SM4 全芯片576 FP16 全芯片1.2 PFLOPS 单核心 FP16~2 TFLOPS
CUDA 核心 并行计算
SM 内的标量浮点运算单元,执行 FP32/FP64 运算。
每 SM128 全芯片18,432 FP32 全芯片67 TFLOPS 单核心 FP32~3.6 GFLOPS
算力单位 性能
TFLOPS = 每秒 10¹² 次浮点运算(万亿次)
PFLOPS = 每秒 10¹⁵ 次浮点运算(千万亿次)
POPS = 每秒 10¹⁵ 次整数运算(千万亿次)
1 PFLOPS = 1000 TFLOPS
H100 FP161.2 PFLOPS 单 Tensor Core~2 TFLOPS 单 CUDA 核心~3.6 GFLOPS
流式多处理器 SM 计算单元
GPU 基本执行单元,包含 CUDA 核心、Tensor Core、SFU、纹理单元、L1 缓存和寄存器堆。
H100 总数144 每 SM 线程2048
L1 缓存 / 共享内存 片内
每 SM 私有,可配置为缓存或共享内存,延迟 ~2 周期。
容量128 KB 延迟~2 周期
L2 统一缓存 全局
全芯片共享,大幅减少显存访问,延迟 ~50 周期。
容量96 MB 延迟~50 周期
寄存器堆 最快
每 SM 私有,每个线程独立寄存器,延迟 1 周期。
容量256 KB 延迟1 周期
混合精度训练 AI 训练
Tensor Core 核心应用,低精度计算梯度,FP32 更新权重。
加速比3-5× 显存节省~50%
FP8 推理 AI 推理
H100 支持 FP8 格式,推理吞吐提升 2 倍。
加速比 精度损失<1%
GPC 调度 调度
NVIDIA 顶层组织单元,负责任务分发到 SM。
H100 GPC9 个 每 GPC SM16 个
PCIe 5.0 互联
CPU-GPU 高速通道,x16 双向带宽。
带宽64 GB/s 延迟~2 μs
HBM3 显存 显存
H100 专用高带宽内存,AI 训练推理标配。
带宽1.5 TB/s 容量80 GB
Transformer 引擎 AI 专属
H100 专用硬件,动态选择最优精度加速 Transformer。
训练加速4-6× 推理加速3-4×
LLM 推理瓶颈 性能
大语言模型推理主要受 显存带宽 限制,而非计算能力。
H100 (70B)~12,000 token/s RTX 4090 (7B)~800 token/s

🧠 主图 + 4 辅助图 · 各自分工

主图:完整的 GPU 架构,从 CPU 到显存的完整数据流。
辅助图 1:SM 内部结构,看清 Tensor Core 的位置。
辅助图 2:存储层次金字塔,理解延迟与容量的权衡。
辅助图 3:AI 推理数据流,关注 HBM3 → L2 → SM 路径。
辅助图 4:⭐ 性能对应关系 — CUDA核心 跑 FP32/FP64,Tensor Core 跑 FP16/FP8/INT8;
图中数字是 全芯片峰值,单核心性能已换算标注。