从自定义算子到原生图
从 custom_op、Triton 与 TVM,到 Stax 原生图下沉,拆开一条可执行、可捕获、可验证的 kernel 路径。
阅读全文从 Dispatcher 到自动微分,记录框架内部的设计选择。
从 custom_op、Triton 与 TVM,到 Stax 原生图下沉,拆开一条可执行、可捕获、可验证的 kernel 路径。
阅读全文从图捕获、PassManager 与 shape guards,到 AOT 自动微分和 Stax 原生执行,明确当前能力与未完成边界。
阅读全文P10、TPX、Stax 与 NN 如何用单向依赖保持计算、微分、图优化和业务逻辑的清晰边界。
阅读全文从 TensorImpl 到 DispatchKey,看同一套张量接口如何抵达 CPU、CUDA 与自定义硬件。
阅读全文不侵入计算核心,通过组合、按需追踪与 GradFn 调度建立完整动态图。
阅读全文