用户代码创建张量、描述计算,无需关心设备差异。
不隐藏计算路径。让每一次前向传播、自动微分与内核执行都可以被阅读、验证和重新组合。
01前向传播
02自动微分
03内核执行
看着网络学会思考。
透明的训练没有黑箱:权重、梯度与决策边界,每一步都摊开在你眼前。
播放开始 · 点击画布重新开始
每一步都可见
梯度如何更新、边界如何成形,全部摊开在眼前,没有黑箱。
权重即线条
线条的粗细就是权重大小,网络结构一眼读懂。
会呼吸的边界
热力图是网络此刻的判断,随训练慢慢贴合数据。
跟着张量走。
从 Python 到原生图,再到梯度与 kernel。每个边界都能读。
FROM OPS
每一次算子调用,都走同一条流水线。
TO RUNTIME
一个运行时,全部承接。
TensorPlay
tensor(x)Python 前端 · 已受理
tp.trace(fn)TPX Graph · 已受理
loss.backward()Autograd · 已受理
graph.compile()编译器 Pass · 已受理
kernel.launch()CUDA 后端 · 已受理
kernel.launch()ROCm 后端 · 已受理
kernel.run()CPU 后端 · 已受理
dtensor.shard()分布式运行时 · 已受理
optimizer.step()优化器 · 已受理
tp.profile()Profiler · 已受理
state.save()Checkpoint · 已受理
graph.export()序列化 · 已受理
清晰,比魔法更重要。
纯净与透明
从 Python 一路追踪到 C++ 核心。每层抽象都可以被剥开,每个操作都有可读路径。
DIY 加速
CPU 与 CUDA 后端保持简洁,为自定义硬件内核、算子和 nanobind 绑定留出实验空间。
模块化自动微分
TPX 将计算与梯度解耦,让动态图、反向传播与新微分模式更容易理解和修改。
科研就绪
用更少样板代码原型化新网络层、优化器、存储格式、算子融合和静态图捕获。
把黑盒拆成四个动词。
P10
执行计算
纯张量计算引擎。负责内存管理、基础内核、Dispatcher 与跨硬件后端。
TPX
追踪变化
显式自动微分层。沿动态图观察数据、梯度与反向传播的完整路径。
Stax
加速图
静态图优化与 JIT 实验场。用于算子融合、图捕获和计算路径优化。
NN
构建网络
面向模型构建的高层神经网络接口。Linear、Conv2d 等组件也是自定义层的蓝图。
先跑起来。再拆开。
选择系统、安装方式和计算平台,生成可直接运行的安装命令。
PYTHON 3.10+CUDA 12.4 · 12.6 · 13.0ROCM 7.2
系统
安装方式
语言Python
计算平台
运行命令bash
python3 -m pip install tensorplay --upgrade从源码内部发来的消息。
从这里继续。
一起把黑盒打开。
学生、开发者、教育者与研究者都可以参与。阅读路线、贡献代码、讨论架构,或订阅项目动态。



