外挂式封装
tpx::Tensor 组合 p10::Tensor,而不向 P10 张量加入梯度字段。纯计算可以直接使用 P10,保持零额外微分开销。
按需追踪
requires_grad 为 true 时,TPX 记录输入、输出、GradFn 与算子参数并建立 DAG;关闭时,前向路径与纯 P10 一致。
调度与执行分离
backward() 先拓扑排序,再调度每个节点的 GradFn。TPX 决定梯度规则,具体张量运算仍由 P10 执行。
可扩展结果
自定义 GradFn 不需要修改 P10。新硬件只需适配计算层,微分模块可以继续复用。
