Modèles de langage visuel : LLaVA, GPT-4V et Gemini

CLIP a montré que les images et le texte peuvent vivre dans le même espace d'intégration. Les modèles de langage de vision (VLM) vont plus loin : ils donnent à un modèle de langage la capacité de comprendre les images - non seulement de les faire correspondre aux légendes, mais aussi de répondre à des questions détaillées, de raisonner sur les relations spatiales, de lire le texte dans les images et de décrire des scènes complexes. GPT-4V, Gemini et LLaVA partagent tous la même architecture de haut niveau : un encodeur visuel (généralement basé sur CLIP), une couche de projection et un modèle de langage.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.