Glosario IA
El diccionario completo de la Inteligencia Artificial
Classifier-Free Guidance
Técnica de guiado que elimina la necesidad de un clasificador externo utilizando el propio modelo para seguir o ignorar una señal de condicionamiento, mejorando así la fidelidad al prompt.
IP-Adapter (Image Prompt Adapter)
Módulo que permite usar una imagen de referencia como prompt, codificando sus características visuales para guiar el proceso de generación sin modificar los pesos del modelo de difusión.
GLIGEN (Grounded Language-to-Image Generation)
Framework que ancla cajas delimitadoras (bounding boxes) a conceptos textuales, permitiendo un control espacial preciso sobre la posición y tamaño de los objetos generados en una imagen.
Cross-Attention Guidance
Mecanismo que explota los mapas de atención cruzada entre texto e imagen para reforzar o debilitar la influencia de partes específicas del prompt sobre zonas de la imagen generada.
LoRA (Low-Rank Adaptation)
Técnica de ajuste fino eficiente que inyecta pequeñas matrices de bajo rango en las capas de atención del modelo, permitiendo aprender nuevos estilos o conceptos con un mínimo de parámetros.
T2I-Adapter (Text-to-Image Adapter)
Módulo ligero que guía un modelo de difusión preentrenado usando condiciones de referencia adicionales (como bocetos o mapas de segmentación) sin requerir un reentrenamiento completo.
UNet Guidance
Proceso de guiado que opera directamente sobre las predicciones de desruido de la arquitectura UNet, modificando la dirección del gradiente para alinear la generación con el condicionamiento deseado.
Attention Refocusing
Método que modifica los mapas de atención para redirigir la importancia de un token de prompt hacia otra región de la imagen, permitiendo reorganizar la composición de los elementos generados.
Guía Semántica
Enfoque que utiliza un modelo semántico externo (ej: CLIP) para calcular una pérdida de guía, asegurando que la imagen generada permanezca alineada con el significado del prompt a nivel conceptual.
Guía Multimodal
Estrategia que combina múltiples tipos de guías (texto, imagen, máscara, mapa de profundidad) simultáneamente para un control jerárquico y multifacético sobre el proceso de generación.
Inversión de Texto Nulo
Técnica de edición de imágenes que invierte el proceso de generación para encontrar un 'prompt nulo' optimizado, permitiendo modificaciones precisas en imágenes reales sin artefactos.
SDEdit (Edición por Ecuación Diferencial Estocástica)
Método que añade ruido a una imagen existente y luego la elimina con una guía, permitiendo editar imágenes reales mientras se conserva su estructura subyacente.