CLIP : apprentissage contrastif sur les couples image-texte
Avant CLIP, les classificateurs d'images ne pouvaient répondre que « de laquelle de ces 1 000 catégories s'agit-il ? ». Ils avaient besoin de milliers d’exemples étiquetés par catégorie et ne pouvaient pas raisonner sur des concepts arbitraires. CLIP a changé cela avec une seule idée : au lieu de prédire un ensemble fixe d'étiquettes, entraînez un modèle pour comprendre si une image et un morceau de texte décrivent la même chose. Formé sur 400 millions de paires image-texte récupérées sur Internet, CLIP a appris un espace d'intégration visuel-langage partagé où les images et leurs descriptions sont proches les unes des autres.