Difusión estable: la arquitectura completa: UNet, VAE y CLIP
Stable Diffusion (Rombach et al., 2022) hizo accesible la generación de texto a imagen de alta calidad combinando tres poderosas ideas independientes: ejecutar la difusión en un espacio latente comprimido (VAE), condicionar incrustaciones de texto enriquecidas (CLIP) y usar una U-Net para la eliminación de ruido. Comprender cómo encajan estos tres componentes es la clave para comprender por qué funciona SD y cómo controlarlo.