Modelos visión-lenguaje: LLaVA, GPT-4V y Gemini

CLIP demostró que las imágenes y el texto pueden vivir en el mismo espacio de incrustación. Los modelos de visión-lenguaje (VLM) van más allá: le dan a un modelo de lenguaje la capacidad de comprender imágenes: no solo relacionarlas con los títulos, sino también responder preguntas detalladas, razonar sobre relaciones espaciales, leer texto en imágenes y describir escenas complejas. GPT-4V, Gemini y LLaVA comparten la misma arquitectura de alto nivel: un codificador visual (generalmente basado en CLIP), una capa de proyección y un modelo de lenguaje.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.