Tech-Renaissance
单人团队以AI技术开发的超轻量级高性能深度学习训练框架
针对 CNN 极致优化 · VGG16BN 等模型单机训练吞吐量超越 PyTorch/TensorFlow
VGG16BN · ImageNet · A100×8 训练吞吐量
Training Throughput(images/sec)· Higher is Better · PyTorch as Baseline
A100 × 8 数据并行 · Batch Size @ 256 × 8 · 自动混合精度 AMP · ImageNet 完整训练 · TOP-1 73.80% · TOP-5 91.71%
4-Layer MLP · 七平台完胜 PyTorch
简单任务高效利用算力资源也是挑战,同等配置下性能远超主流深度学习框架
(对比为严格公平对比,双方使用完全相同的超参数、模型结构、训练算法和预处理线程数,且均开启 AMP,PyTorch 开启 torch.compile 且排除编译用时)
极简 API · 极致性能
34 行代码完整训练 MLP 至 99.4% 以上的 MNIST 准确率,平均训练速度达 PyTorch 的 9.71 倍
1 #include "renaissance.h"
2 using namespace tr;
3 int main() {
4 GLOBAL_SETTING
5 .use_gpu("0").amp(true).manual_seed(123)
6 .global_batch_size(200).input_resolution(28);
7 PREPROCESSOR_SETTING
8 .dataset("mnist", "/data/mnist")
9 .preprocess_workers(8)
10 .normalization(NormMode::MNIST)
11 .train_transforms(
12 Pad(2),
13 RandomCrop(28),
14 RandomRotation(20.0f, 0),
15 RandomScale(0.8f, 1.2f),
16 RandomErasing(0.5f)
17 )
18 .commit();
19 BluePrint mlp = seq(
20 fc(1024, true), relu(),
21 fc(512, true), relu(),
22 fc(256, true), relu(),
23 fc(10, true)
24 );
25 DeepLearningTask task;
26 task.model(mlp)
27 .loss(CrossEntropyLoss().label_smoothing(0.1f))
28 .total_epochs(100)
29 .optimizer(AdamW().weight_decay(1e-4f))
30 .scheduler(CosineAnnealingLR().base_lr(0.001f).warmup(5));
31 task.compile();
32 task.run();
33 return 0;
34 }
四步运行
sudo mkdir -p /opt/tr4 && cd /opt/tr4
git clone https://gitee.com/tech-renaissance/renaissance.git
docker pull crpi-vbtd6yj00u83ugqk.cn-beijing.personal.cr.aliyuncs.com/tech-renaissance/tr4:v4.20
docker run -d -it --name tr4-dev --gpus all --cap-add SYS_NICE -v /opt/tr4:/opt/tr4 -w /opt/tr4 \
crpi-vbtd6yj00u83ugqk.cn-beijing.personal.cr.aliyuncs.com/tech-renaissance/tr4:v4.20 tail -f /dev/null
docker exec -it tr4-dev bash
cd /opt/tr4/renaissance && python configure.py
./build.sh
/opt/tr4/renaissance/build/bin/tests/example/mlp_mnist
备用镜像下载链接: https://pan.baidu.com/s/183ZphxnF4rz6pwaRqP0-7g 提取码: TRV4
最新进展
VGG16BN ImageNet 训练成功
A100×8 平台训练吞吐量 9310.13 images/sec,在当前测试任务与配置下取得显著训练吞吐优势,较 PyTorch 基线提升约 26.65%,较 TensorFlow 提升约 19.88%
2026年6月28日
技术觉醒 V4.20 版重磅发布
2026年7月1日,技术觉醒深度学习框架发布 V4.20 版,该版本支持超高性能的单机多卡数据并行训练,代码完全开源,文档和博客文章同步上线!
2026年7月1日技术特色
自研算子融合路径
Conv+BN+ReLU、数据增强、优化器、NCCL通信等多个关键路径实现深度算子融合,减少算子边界开销,节省显存带宽
CUDA Graph 捕获
高度优化计算图和训练流程,以CUDA Graph捕获技术消除 CPU-GPU 调度延迟,稳定提升训练迭代吞吐效率
静态显存规划
预规划 Tensor 生命周期,科学分区设计,支持高效批量操作,消除动态分配时间开销和内存碎片
AI 辅助系统开发
与多个 LLM 协同完成架构设计、算子实现、调试优化,重新定义单人高强度系统开发的极致水准