ControlNet y IP-Adapter: generación de imágenes controlada
Las indicaciones de texto son expresivas pero imprecisas. "Una persona de pie con los brazos en alto" describe miles de posturas diferentes. Si necesita una composición específica (un personaje en una pose exacta, una habitación con un mapa de profundidad específico, un rostro con una identidad conocida), el texto por sí solo no puede lograrla. ControlNet e IP-Adapter resuelven esto agregando acondicionamiento estructural o visual encima de la tubería de Difusión Estable existente.