P10:计算基石
P10 专注张量计算,不包含自动微分逻辑。Tensor 与 TensorImpl 的多态设计连接 CPU、CUDA 与自定义硬件。
TPX:微分扩展层
TPX 组合 P10 张量并附加 grad 与 grad_fn。纯推理场景可以完全不加载微分逻辑。
Stax:性能引擎
Stax 捕获 P10 操作,通过算子融合、内存优化等编译技术实验静态图加速。
NN:业务封装层
NN 在 P10 与 TPX 之上提供 Linear、Conv、Adam、SGD 等 PyTorch 兼容组件。
单向依赖
NN 指向 TPX 与 P10,Stax 指向 P10。各组件可以独立开发、编译、测试、升级和按需组合。
