Imagen
Text-to-Image Diffusion Models
Vinod
Introduction
How Imagen Works: A Bird’s-Eye View
Text Encoder
Image Generator
Image Super Resolution
Text Encoder
Image Generator – Network Architecture
Image Generator – Timestep Conditioning
Image Generator – Caption Conditioning
Image Generator – Classifier-Free Guidance
Image Generator – Large Guidance Weight Samplers
Super-Resolution Models
Results and Analysis
DrawBench
Why is Imagen Better than DALL-E 2?
Key Takeaways
Training details
Limitations
References