CLIP : apprentissage contrastif sur les couples image-texte

Avant CLIP, les classificateurs d'images ne pouvaient répondre que « de laquelle de ces 1 000 catégories s'agit-il ? ». Ils avaient besoin de milliers d’exemples étiquetés par catégorie et ne pouvaient pas raisonner sur des concepts arbitraires. CLIP a changé cela avec une seule idée : au lieu de prédire un ensemble fixe d'étiquettes, entraînez un modèle pour comprendre si une image et un morceau de texte décrivent la même chose. Formé sur 400 millions de paires image-texte récupérées sur Internet, CLIP a appris un espace d'intégration visuel-langage partagé où les images et leurs descriptions sont proches les unes des autres.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.