CLIP: aprendizaje contrastivo sobre pares imagen-texto

Antes de CLIP, los clasificadores de imágenes solo podían responder "¿cuál de estas 1000 categorías es esta?". Necesitaban miles de ejemplos etiquetados por categoría y no podían razonar sobre conceptos arbitrarios. CLIP cambió esto con una única idea: en lugar de predecir un conjunto fijo de etiquetas, entrene un modelo para comprender si una imagen y un fragmento de texto describen lo mismo. CLIP, entrenado con 400 millones de pares de imágenes y texto extraídos de Internet, aprendió un espacio compartido de incrustación de lenguaje visual donde las imágenes y sus descripciones están muy juntas.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.