Modèles de langage visuel : LLaVA, GPT-4V et Gemini
CLIP a montré que les images et le texte peuvent vivre dans le même espace d'intégration. Les modèles de langage de vision (VLM) vont plus loin : ils donnent à un modèle de langage la capacité de comprendre les images - non seulement de les faire correspondre aux légendes, mais aussi de répondre à des questions détaillées, de raisonner sur les relations spatiales, de lire le texte dans les images et de décrire des scènes complexes. GPT-4V, Gemini et LLaVA partagent tous la même architecture de haut niveau : un encodeur visuel (généralement basé sur CLIP), une couche de projection et un modèle de langage.