Latent Diffusion
Text Encoder
Model (often a Transformer like CLIP) that transforms a character string into a numerical vector in the latent space, providing conditioning for image generation.
← Zurück