Tech-Renaissance Main Visual

Tech-Renaissance

技术觉醒
V4.20版发布

单人团队以AI技术开发的超轻量级高性能深度学习训练框架

针对 CNN 极致优化 · VGG16BN 等模型单机训练吞吐量超越 PyTorch/TensorFlow

VGG16BN · ImageNet · A100×8 训练吞吐量

Training Throughput(images/sec)· Higher is Better · PyTorch as Baseline

Tech-Renaissance
9,310.13 images/sec · +26.65% faster
TensorFlow + XLA
7,766.34 images/sec · +5.65% faster
PyTorch + torch.compile
7,351.20 images/sec · baseline
FrameworkEpoch Timevs PyTorch
Tech-Renaissance137.610s+26.65% faster ✓
TensorFlow + XLA164.964s+5.65% faster
PyTorch + torch.compile174.280sbaseline

A100 × 8 数据并行 · Batch Size @ 256 × 8 · 自动混合精度 AMP · ImageNet 完整训练 · TOP-1 73.80% · TOP-5 91.71%

4-Layer MLP · 七平台完胜 PyTorch

简单任务高效利用算力资源也是挑战,同等配置下性能远超主流深度学习框架

4-Layer MLP 七平台性能对比

不同平台的MLP训练速度对比

(对比为严格公平对比,双方使用完全相同的超参数、模型结构、训练算法和预处理线程数,且均开启 AMP,PyTorch 开启 torch.compile 且排除编译用时)

极简 API · 极致性能

34 行代码完整训练 MLP 至 99.4% 以上的 MNIST 准确率,平均训练速度达 PyTorch 的 9.71

全局参数 | 数据管线 极简配置
1  #include "renaissance.h"
2  using namespace tr;
3  int main() {
4      GLOBAL_SETTING
5          .use_gpu("0").amp(true).manual_seed(123)
6          .global_batch_size(200).input_resolution(28);
7      PREPROCESSOR_SETTING
8          .dataset("mnist", "/data/mnist")
9          .preprocess_workers(8)
10          .normalization(NormMode::MNIST)
11          .train_transforms(
12              Pad(2),
13              RandomCrop(28),
14              RandomRotation(20.0f, 0),
15              RandomScale(0.8f, 1.2f),
16              RandomErasing(0.5f)
17          )
18          .commit();
神经网络 | 训练任务 高效定义
19      BluePrint mlp = seq(
20          fc(1024, true), relu(),
21          fc(512, true), relu(),
22          fc(256, true), relu(),
23          fc(10, true)
24      );
25      DeepLearningTask task;
26      task.model(mlp)
27          .loss(CrossEntropyLoss().label_smoothing(0.1f))
28          .total_epochs(100)
29          .optimizer(AdamW().weight_decay(1e-4f))
30          .scheduler(CosineAnnealingLR().base_lr(0.001f).warmup(5));
31      task.compile();
32      task.run();
33      return 0;
34  }

四步运行

1 克隆项目
sudo mkdir -p /opt/tr4 && cd /opt/tr4
git clone https://gitee.com/tech-renaissance/renaissance.git
docker pull crpi-vbtd6yj00u83ugqk.cn-beijing.personal.cr.aliyuncs.com/tech-renaissance/tr4:v4.20
docker run -d -it --name tr4-dev --gpus all --cap-add SYS_NICE -v /opt/tr4:/opt/tr4 -w /opt/tr4 \
    crpi-vbtd6yj00u83ugqk.cn-beijing.personal.cr.aliyuncs.com/tech-renaissance/tr4:v4.20 tail -f /dev/null
docker exec -it tr4-dev bash
2 启动容器
3 配置编译
cd /opt/tr4/renaissance && python configure.py
./build.sh
/opt/tr4/renaissance/build/bin/tests/example/mlp_mnist
4 运行示例

备用镜像下载链接: https://pan.baidu.com/s/183ZphxnF4rz6pwaRqP0-7g 提取码: TRV4

最新进展

VGG16BN Training
里程碑

VGG16BN ImageNet 训练成功

A100×8 平台训练吞吐量 9310.13 images/sec,在当前测试任务与配置下取得显著训练吞吐优势,较 PyTorch 基线提升约 26.65%,较 TensorFlow 提升约 19.88%

2026年6月28日
V4.20 Release
重磅发布

技术觉醒 V4.20 版重磅发布

2026年7月1日,技术觉醒深度学习框架发布 V4.20 版,该版本支持超高性能的单机多卡数据并行训练,代码完全开源,文档和博客文章同步上线!

2026年7月1日

技术特色

自研算子融合路径

Conv+BN+ReLU、数据增强、优化器、NCCL通信等多个关键路径实现深度算子融合,减少算子边界开销,节省显存带宽

CUDA Graph 捕获

高度优化计算图和训练流程,以CUDA Graph捕获技术消除 CPU-GPU 调度延迟,稳定提升训练迭代吞吐效率

静态显存规划

预规划 Tensor 生命周期,科学分区设计,支持高效批量操作,消除动态分配时间开销和内存碎片

AI 辅助系统开发

与多个 LLM 协同完成架构设计、算子实现、调试优化,重新定义单人高强度系统开发的极致水准

技术觉醒框架开发者简介

姜玉麟 博士

AI芯片架构 深度学习系统 高性能计算 异构计算 存内计算

技术觉醒团队里唯一的人类。长期关注AI算法、AI芯片与深度学习系统优化。 曾完成多个基于非易失性存储器的神经网络硬件系统的设计实现。 2026年上半年在AI编程工具辅助下用业余时间开发了技术觉醒框架, 致力于探索基于AI芯片的深度学习训练性能极致优化的新范式。