做法
- 基于 PyTorch 的 GAN,做 MNIST 手写数字生成
- 实现 Vision Transformer 的核心组件
- 探索预训练 ViT 的图像推理
为什么它值得留在这里
这是六个项目里分量最轻的一个,价值不在成果而在基础:注意力、分块嵌入、对抗训练这些东西,读论文和自己写一遍是两回事。 后来做 VLA 相关工作时,这一层不用重新补。
课程项目 · 卡尔斯鲁厄理工学院(KIT)
生成模型与 Transformer 视觉架构的从零实现
用 PyTorch 从零实现生成模型与 Transformer 视觉架构的核心组件,覆盖搭建、训练到推理验证的完整流程。
这是六个项目里分量最轻的一个,价值不在成果而在基础:注意力、分块嵌入、对抗训练这些东西,读论文和自己写一遍是两回事。 后来做 VLA 相关工作时,这一层不用重新补。