ControlNet et IP-Adapter : génération d'images contrôlées
Les invites textuelles sont expressives mais imprécises. « Une personne debout, les bras levés » décrit des milliers de poses différentes. Si vous avez besoin d’une composition spécifique – un personnage dans une pose exacte, une pièce avec une carte de profondeur spécifique, un visage avec une identité connue – le texte seul ne peut pas la fournir. ControlNet et IP-Adapter résolvent ce problème en ajoutant un conditionnement structurel ou visuel au-dessus du pipeline de diffusion stable existant.