2.4.2. Neutron v4 架构#
Neutron v4 由 1 个 NPU Core 构成,Core 内包含 1 个 CONV、 1 个 TENG 和 1 个 SDMA。与 Neutron v3 通过物理基础资源组合形成 vNPU 的方式不同,Neutron v4 通过硬件时分复用技术,在同一组物理 EU 上虚拟出 2 个 vNPU。
CONV和TENG属于计算类 EU,负责模型推理中的卷积、张量/向量计算等计算任务;SDMA属于数据搬运类 EU,负责 DDR 与 OCM 之间的数据读写以及片上数据搬运。硬件时分复用机制会在两个逻辑 vNPU 之间调度计算类 EU 和数据搬运类 EU,使不同推理任务的计算阶段与通信阶段交错运行。例如,一个 vNPU 进行
CONV/TENG计算时,另一个 vNPU 可以通过SDMA准备输入、加载权重或写回结果,从而提高物理 EU 的整体利用率。启用时分复用后,两个逻辑 vNPU 会共享片上资源,单个 vNPU 可用的 OCM 会少于关闭时分复用时的完整 NPU 资源。
2.4.2.1. 工作模式与 npu_mode#
2.4.2.1.1. AXEngine 运行时工作模式#
AXEngine 工作模式 |
计算资源说明 |
|---|---|
|
启用逻辑 vNPU 划分,在同一组物理 EU 上虚拟出 2 个 vNPU;两个逻辑 vNPU 共享物理 EU 和 OCM,单个 vNPU 可用 OCM 会减少。 |
|
关闭逻辑 vNPU 划分,不启用硬件时分复用;运行时暴露 1 个完整 NPU 资源,模型使用全部 NPU 资源推理。 |
2.4.2.1.2. 离线 npu_mode 与硬件资源#
芯片平台 |
|
硬件计算资源对应关系 |
|---|---|---|
|
|
时分复用模式下的 1 个逻辑 vNPU 编译资源,可用 OCM 少于完整 NPU 资源模式。 |
|
|
关闭时分复用时的完整 NPU 编译资源,使用全部 NPU 资源推理,可用 OCM 多于时分复用模式下的单个逻辑 vNPU。 |
|
|
时分复用模式下的 1 个逻辑 vNPU 编译资源,可用 OCM 少于完整 NPU 资源模式。 |
|
|
关闭时分复用时的完整 NPU 编译资源,使用全部 NPU 资源推理,可用 OCM 多于时分复用模式下的单个逻辑 vNPU。 |
|
|
时分复用模式下的 1 个逻辑 vNPU 编译资源,可用 OCM 少于完整 NPU 资源模式。 |
|
|
关闭时分复用时的完整 NPU 编译资源,使用全部 NPU 资源推理,可用 OCM 多于时分复用模式下的单个逻辑 vNPU。 |