โมเดลภาษาวิสัยทัศน์: LLaVA, GPT-4V และ Gemini

คลิปแสดงให้เห็นว่ารูปภาพและข้อความสามารถอยู่ในพื้นที่ฝังเดียวกันได้ โมเดลภาษาวิสัยทัศน์ (VLM) ก้าวไปอีกขั้น โดยให้โมเดลภาษาสามารถ เข้าใจ ภาพได้ ไม่ใช่แค่จับคู่ภาพกับคำบรรยายเท่านั้น แต่ยังตอบคำถามโดยละเอียด เหตุผลเกี่ยวกับความสัมพันธ์เชิงพื้นที่ อ่านข้อความในภาพ และอธิบายฉากที่ซับซ้อน GPT-4V, Gemini และ LLaVA ล้วนมีสถาปัตยกรรมระดับสูงที่เหมือนกัน ได้แก่ ตัวเข้ารหัสภาพ (โดยปกติจะเป็นแบบ CLIP) เลเยอร์การฉายภาพ และโมเดลภาษา

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.