CLIP: aprendizaje contrastivo sobre pares imagen-texto
Antes de CLIP, los clasificadores de imágenes solo podían responder "¿cuál de estas 1000 categorías es esta?". Necesitaban miles de ejemplos etiquetados por categoría y no podían razonar sobre conceptos arbitrarios. CLIP cambió esto con una única idea: en lugar de predecir un conjunto fijo de etiquetas, entrene un modelo para comprender si una imagen y un fragmento de texto describen lo mismo. CLIP, entrenado con 400 millones de pares de imágenes y texto extraídos de Internet, aprendió un espacio compartido de incrustación de lenguaje visual donde las imágenes y sus descripciones están muy juntas.