架构
计算、微分、图优化与网络组件严格解耦,只保留单向依赖。
P10
纯张量计算引擎。负责 Tensor、TensorImpl、内存、算子、Dispatcher 与硬件后端,不嵌入自动微分逻辑。
TPX
显式自动微分层。组合 P10 张量,按需记录动态图,调度 GradFn,并把数值计算交回 P10。
Stax
静态图与 JIT 优化层。捕获 P10 操作,实验算子融合、内存优化和部署加速。
NN
高层网络业务层。提供 Linear、Conv、损失函数、优化器和可扩展 Module,同时保留向下追踪的路径。
为什么这样分层
- 各库可以独立开发、编译、测试和升级。
- 新增硬件主要落在 P10,新增微分模式主要落在 TPX。
- 纯计算任务无需支付自动微分或静态图的额外成本。
- 清晰边界让框架内部更适合教学和研究。
