达芬奇架构 核心架构
华为自研 NPU 架构,采用 Cube + Vector + Scalar 铁三角设计。
针对 AI 领域定制,覆盖端、边、云全场景。
设计理念DSA 特定域架构
核心单元Cube/Vector/Scalar
特色MTE 硬件转置
AI Core 计算核心
昇腾 NPU 的计算核心,包含矩阵(Cube)、向量(Vector)、标量(Scalar)三种计算单元,
配合多级缓存完成 AI 计算。
每芯片数量32 (910)
计算模式SIMD/SIMT 混合
Cube 矩阵计算单元 矩阵
执行 16×16×16 矩阵乘加,一条指令完成 4096 次乘加。
是 AI 训练/推理的算力核心。
每 AI Core1 个
精度支持INT8/FP16
910 FP16256 TFLOPS
Vector 向量计算单元 向量
执行向量运算,包括 激活函数、归一化、池化 等,
支持 FP16/FP32 精度。
每 AI Core1 个
精度支持FP16/FP32
典型用途激活/归一化
Scalar 标量计算单元 标量
负责 控制流、地址计算、标量运算,协调 Cube 和 Vector 的执行。
每 AI Core1 个
功能控制/调度
存储转换单元 MTE 特色
达芬奇架构特色,位于 NPU 芯片内部 AI Core 集群。
硬件级数据格式转换(如 Img2Col),大幅提升卷积效率。
功能数据格式转换
对比 GPU硬件加速 vs 软件实现
位置AI Core 集群内
CANN 异构计算架构 软件栈
华为 NPU 软件栈,向上兼容 PyTorch/MindSpore,向下使能昇腾硬件。
包含算子库、编译器等。
编程语言Ascend C
框架支持PyTorch/MindSpore
HBM 显存 显存
昇腾 NPU 专用高带宽内存,HBM2e/HBM3,为大模型提供高吞吐数据访问。
910B 带宽400 GB/s
910B3 带宽1.2 TB/s
容量64-80 GB
Unified Buffer 片内缓存
AI Core 内统一缓冲区,向量/标量计算的数据中转站,
容量约 248 KB。
位置AI Core 内部
容量~248 KB
用途向量/标量数据
HCCL 通信库 多卡互联
华为集合通信库,支持多卡训练时的 AllReduce、Broadcast 等
集合通信操作。
功能多卡通信
对标NVIDIA NCCL
数字视觉预处理 DVPP 预处理
硬件级图像/视频预处理,包括 缩放、拼接、编解码,
减轻 AI Core 负担。
功能图像预处理
优势硬件加速
混合精度训练 AI 训练
Cube 支持 FP16/BF16 混合精度,在保持精度的同时大幅提升训练吞吐量。
精度支持FP16/BF16/INT8
910 FP16256 TFLOPS
昇腾910 旗舰芯片
华为云端训练芯片,32 个 AI Core,支持千亿参数大模型训练。
910B3 引入 HBM3e 内存。
AI Core32 个
FP16 算力256-320 TFLOPS
工艺7nm (N+1/N+2)
昇腾310 推理芯片
华为边缘推理 SoC,低功耗设计,面向端侧 AI 推理场景。
功耗仅 8W。
FP16 算力8 TFLOPS
INT8 算力16 TOPS
功耗8W
算力单位 性能
TFLOPS = 每秒 10¹² 次浮点运算 (万亿次)
TOPS = 每秒 10¹² 次整数运算 (万亿次)
910 FP16256 TFLOPS
310 INT816 TOPS
🧠 主图 + 4 辅助图 · 各自分工
主图:完整的昇腾 NPU 架构,MTE 位于 NPU 芯片内部 AI Core 集群。
辅助图 1:AI Core 内部结构 — Cube/Vector/Scalar 铁三角 + MTE。
辅助图 2:存储层次金字塔 — 从寄存器到 HBM 的延迟与容量。
辅助图 3:AI 推理数据流 — HBM → L2 → MTE → AI Core 完整路径。
辅助图 4:计算单元对比 — Cube 4096次/指令、FP16 256 TFLOPS。
💡 核心差异:GPU 用 CUDA 核心做标量,Tensor Core 做矩阵;
昇腾 NPU 用 Cube 做矩阵(专用最强),Vector 做向量(灵活),Scalar 做标量(控制)