Vorgehen
- Ein GAN auf PyTorch-Basis zur Erzeugung handgeschriebener Ziffern auf MNIST
- Zentrale Komponenten eines Vision Transformers von Grund auf implementiert
- Bildinferenz mit einem vortrainierten ViT erprobt
Warum es hier bleibt
Von den sechs Projekten ist dieses das kleinste, und sein Wert liegt in der Grundlage, nicht im Ergebnis: Über Attention, Patch-Embedding und adversariales Training zu lesen ist etwas anderes, als sie selbst zu schreiben. Als die spätere Arbeit in Richtung VLA ging, musste diese Ebene nicht neu erarbeitet werden.