โมเดลภาษาวิสัยทัศน์: LLaVA, GPT-4V และ Gemini
คลิปแสดงให้เห็นว่ารูปภาพและข้อความสามารถอยู่ในพื้นที่ฝังเดียวกันได้ โมเดลภาษาวิสัยทัศน์ (VLM) ก้าวไปอีกขั้น โดยให้โมเดลภาษาสามารถ เข้าใจ ภาพได้ ไม่ใช่แค่จับคู่ภาพกับคำบรรยายเท่านั้น แต่ยังตอบคำถามโดยละเอียด เหตุผลเกี่ยวกับความสัมพันธ์เชิงพื้นที่ อ่านข้อความในภาพ และอธิบายฉากที่ซับซ้อน GPT-4V, Gemini และ LLaVA ล้วนมีสถาปัตยกรรมระดับสูงที่เหมือนกัน ได้แก่ ตัวเข้ารหัสภาพ (โดยปกติจะเป็นแบบ CLIP) เลเยอร์การฉายภาพ และโมเดลภาษา