Modelos visión-lenguaje: LLaVA, GPT-4V y Gemini
CLIP demostró que las imágenes y el texto pueden vivir en el mismo espacio de incrustación. Los modelos de visión-lenguaje (VLM) van más allá: le dan a un modelo de lenguaje la capacidad de comprender imágenes: no solo relacionarlas con los títulos, sino también responder preguntas detalladas, razonar sobre relaciones espaciales, leer texto en imágenes y describir escenas complejas. GPT-4V, Gemini y LLaVA comparten la misma arquitectura de alto nivel: un codificador visual (generalmente basado en CLIP), una capa de proyección y un modelo de lenguaje.