CLIP: การเรียนรู้แบบเปรียบเทียบระหว่างรูปภาพและข้อความ
ก่อน CLIP ตัวแยกประเภทรูปภาพสามารถตอบได้เพียงว่า 'หมวดหมู่ใดใน 1,000 หมวดนี้คือหมวดหมู่ใด' พวกเขาต้องการตัวอย่างที่มีป้ายกำกับหลายพันตัวอย่างต่อหมวดหมู่ และไม่สามารถให้เหตุผลเกี่ยวกับแนวคิดที่กำหนดเองได้ CLIP เปลี่ยนแปลงสิ่งนี้ด้วยข้อมูลเชิงลึกเพียงข้อเดียว แทนที่จะคาดการณ์ชุดป้ายกำกับที่ตายตัว ให้ฝึกแบบจำลองเพื่อทำความเข้าใจว่ารูปภาพและข้อความบรรยายถึงสิ่งเดียวกันหรือไม่ ด้วยการฝึกอบรมคู่รูปภาพและข้อความ 400 ล้านคู่ที่คัดลอกมาจากอินเทอร์เน็ต CLIP เรียนรู้พื้นที่ฝังภาษาภาพที่ใช้ร่วมกันโดยที่รูปภาพและคำอธิบายอยู่ใกล้กัน