2.4.3. Neutron v6 架构#
Neutron v6 基于 Neutron v4 架构对功耗及面积进行迭代优化,整体延续 1 个 NPU Core、 1 个 CONV、 1 个 TENG、 1 个 SDMA 以及可选的双 vNPU 时分复用资源组织方式。
与 Neutron v4 类似,Neutron v6 仍将 EU 分为计算类和数据搬运类两类。启用时分复用后,两个逻辑 vNPU 可以让不同推理任务的计算阶段与通信阶段交错运行,同时两个逻辑 vNPU 会共享片上资源,单个 vNPU 可用的 OCM 会少于关闭时分复用时的完整 NPU 资源。
部分 Neutron v6 平台仅开放单 NPU 资源模式,实际可选项请参考下方工作模式与
npu_mode说明。
2.4.3.1. 工作模式与 npu_mode#
2.4.3.1.1. AXEngine 运行时工作模式#
芯片平台 |
AXEngine 工作模式 |
计算资源说明 |
|---|---|---|
|
|
启用逻辑 vNPU 划分,在同一 NPU Core 上通过硬件时分复用调度双 vNPU 资源;两个逻辑 vNPU 共享片上资源,单个 vNPU 可用 OCM 会减少。 |
|
|
关闭逻辑 vNPU 划分,不启用硬件时分复用;运行时暴露 1 个完整 NPU 资源,模型使用全部 NPU 资源推理。 |
|
|
仅支持单 NPU 资源模式。 |
|
|
仅支持单 NPU 资源模式。 |
2.4.3.1.2. 离线 npu_mode 与硬件资源#
芯片平台 |
|
硬件计算资源对应关系 |
|---|---|---|
|
|
时分复用模式下的 1 个逻辑 vNPU 编译资源,可用 OCM 少于完整 NPU 资源模式。 |
|
|
关闭时分复用时的完整 NPU 编译资源,使用全部 NPU 资源推理,可用 OCM 多于时分复用模式下的单个逻辑 vNPU。 |
|
|
1 个 NPU Core,包含 1 个 |
|
|
1 个 NPU Core,包含 1 个 |