TensorPlay AI
打开导航

看懂计算。 改造它。

从 Tensor 到 kernel,层层可读。一个面向学习、研究和硬件实验的透明框架。

PYTHON / C++ 核心CUDA · ROCM 后端
向下滚动

不隐藏计算路径。让每一次前向传播、自动微分与内核执行都可以被阅读、验证和重新组合。

01前向传播
02自动微分
03内核执行
ONE GRAPH. EVERY GRADIENT.

看着网络学会思考。

透明的训练没有黑箱:权重、梯度与决策边界,每一步都摊开在你眼前。

circle · epoch 000000 · train 1.000 · test 1.000
播放开始 · 点击画布重新开始

每一步都可见

梯度如何更新、边界如何成形,全部摊开在眼前,没有黑箱。

权重即线条

线条的粗细就是权重大小,网络结构一眼读懂。

会呼吸的边界

热力图是网络此刻的判断,随训练慢慢贴合数据。

跟着张量走。

从 Python 到原生图,再到梯度与 kernel。每个边界都能读。

FROM OPS

每一次算子调用,都走同一条流水线。

TO RUNTIME

一个运行时,全部承接。

TensorPlay
tensor(x)Python 前端 · 已受理
tp.trace(fn)TPX Graph · 已受理
loss.backward()Autograd · 已受理
graph.compile()编译器 Pass · 已受理
kernel.launch()CUDA 后端 · 已受理
kernel.launch()ROCm 后端 · 已受理
kernel.run()CPU 后端 · 已受理
dtensor.shard()分布式运行时 · 已受理
optimizer.step()优化器 · 已受理
tp.profile()Profiler · 已受理
state.save()Checkpoint · 已受理
graph.export()序列化 · 已受理
算子执行示意

清晰,比魔法更重要。

纯净与透明

从 Python 一路追踪到 C++ 核心。每层抽象都可以被剥开,每个操作都有可读路径。

DIY 加速

CPU 与 CUDA 后端保持简洁,为自定义硬件内核、算子和 nanobind 绑定留出实验空间。

模块化自动微分

TPX 将计算与梯度解耦,让动态图、反向传播与新微分模式更容易理解和修改。

科研就绪

用更少样板代码原型化新网络层、优化器、存储格式、算子融合和静态图捕获。

把黑盒拆成四个动词。

P10

执行计算

纯张量计算引擎。负责内存管理、基础内核、Dispatcher 与跨硬件后端。

TPX

追踪变化

显式自动微分层。沿动态图观察数据、梯度与反向传播的完整路径。

Stax

加速图

静态图优化与 JIT 实验场。用于算子融合、图捕获和计算路径优化。

NN

构建网络

面向模型构建的高层神经网络接口。Linear、Conv2d 等组件也是自定义层的蓝图。

先跑起来。再拆开。

选择系统、安装方式和计算平台,生成可直接运行的安装命令。

PYTHON 3.10+CUDA 12.4 · 12.6 · 13.0ROCM 7.2
系统
安装方式
语言Python
计算平台
运行命令bash
python3 -m pip install tensorplay --upgrade

从源码内部发来的消息。

从这里继续。

一起把黑盒打开。

学生、开发者、教育者与研究者都可以参与。阅读路线、贡献代码、讨论架构,或订阅项目动态。

Ask DeepWiki