รุ่นเทียบกับการเลือกปฏิบัติ: อะไรคือความแตกต่าง

งาน ML แบบคลาสสิกส่วนใหญ่จะ เลือกปฏิบัติ: โมเดลเรียนรู้ที่จะแมปอินพุต X กับป้ายกำกับ Y ตัวกรองสแปมจะส่งออกสแปม / ไม่ใช่สแปม ตัวตรวจจับวัตถุส่งคืนพิกัดกล่องขอบเขต โมเดลนี้สร้าง การอนุมานเกี่ยวกับข้อมูลที่มีอยู่ โดยไม่ได้สร้างอะไรใหม่เลย

โมเดลเชิงกำเนิด — โมเดลที่เรียนรู้การกระจายข้อมูล P(X) และสามารถ ตัวอย่างตัวอย่างใหม่ จากโมเดลดังกล่าว แทนที่จะถามว่า "วัตถุนี้คืออะไร" มันตอบว่า "วัตถุทั่วไปจากโลกนี้มีลักษณะเป็นอย่างไร" GPT สร้างข้อความที่ไม่เคยมีมาก่อน การกระจายที่เสถียรจะวาดภาพจากสัญญาณรบกวนแบบสุ่มล้วนๆ
ความแตกต่างที่สำคัญระหว่างทั้งสองแนวทาง
ด้านเลือกปฏิบัติกำเนิด
เป้าหมายการฝึกอบรมป้ายทำนาย P(Y|X)โมเดลการกระจายข้อมูล P(X) หรือ P(X|Y)
เอาท์พุตคลาส,หมายเลข,กรอบขอบข้อความ รูปภาพ เสียง วิดีโอใหม่
ป้ายกำกับจำเป็น (มีการควบคุมดูแล)มักไม่จำเป็น (ดูแลตนเอง)
ตัวอย่างงานการจำแนกประเภท การถดถอย NERการสร้างข้อความ การสังเคราะห์ภาพ การแปล
ตัวอย่างโมเดลเบิร์ต, SVM, XGBoost, ResNetGPT, Claude, การแพร่กระจายที่เสถียร, GAN, VAE

ขอบเขตนั้นไม่แน่นอน BERT ฝึกฝนโดยไม่มีป้ายกำกับ (การทำนายโทเค็นที่ปกปิด) แต่ใช้สำหรับงานที่เลือกปฏิบัติ ตัวแยกประเภทที่ใช้ GPT ในทางเทคนิคแล้วเป็นสถาปัตยกรรมเชิงกำเนิดที่ใช้สำหรับการเลือกปฏิบัติ ความแตกต่างที่สำคัญอยู่ที่วัตถุประสงค์การฝึกอบรม ไม่ใช่สถาปัตยกรรม

แผนที่ของ AI กำเนิด: หกตระกูล
คลิกการ์ดเพื่อเรียนรู้เพิ่มเติม
เหตุใด generative AI จึงเป็นไปได้ในขณะนี้

แนวคิดเบื้องหลังโมเดลเชิงกำเนิดไม่ใช่เรื่องใหม่ GAN เปิดตัวในปี 2014 และ VAE ในปี 2013 สิ่งที่เปลี่ยนแปลงคือ การบรรจบกันของปัจจัยสามประการ ที่ทำให้การฝึกอบรมในวงกว้างเป็นไปได้และมีประสิทธิผล

ปัจจัยสามประการมาบรรจบกันเพื่อทำให้ GenAI เป็นไปได้ ▶
หม้อแปลงไฟฟ้า
2017: การเอาใจใส่ตนเอง
จีพียู/ทีพียู
×10,000 เทียบกับปี 2012
ข้อมูล
องค์กรระดับอินเทอร์เน็ต
กฎหมายมาตราส่วน
ข้อมูลเพิ่มเติม + พารามิเตอร์ = ดีกว่า
GenAI
GPT-3 → GPT-4 → คลอดด์

ประเด็นสำคัญ

AI เชิงสร้างสรรค์เป็นการเปลี่ยนกระบวนทัศน์: แทนที่จะอนุมานป้ายกำกับจากข้อมูล แบบจำลองเรียนรู้ที่จะสร้างข้อมูลใหม่ที่ดูเหมือนว่ามาจากการกระจายแบบเดียวกัน สิ่งนี้เกิดขึ้นได้จริงผ่านการผสานรวมของสถาปัตยกรรมหม้อแปลงไฟฟ้า การปรับขนาดการประมวลผล GPU และชุดข้อมูลระดับอินเทอร์เน็ต
โมเดล จำแนก เรียนรู้ P(Y|X) — การจับคู่อินพุตกับป้ายกำกับ
โมเดล เจนเนอเรทีฟ เรียนรู้ P(X) — การกระจายข้อมูลซึ่งสามารถสุ่มตัวอย่างใหม่ๆ ได้
สถาปัตยกรรมสามารถเหมือนกันได้ (ทั้งคู่ใช้หม้อแปลง) — ความแตกต่างอยู่ที่วัตถุประสงค์การฝึกอบรม
หกตระกูลหลัก: LLM, Diffusion, GAN, VAE, Audio Gen, Video Gen
GenAI ใช้งานได้จริงผ่านหม้อแปลงไฟฟ้า (2017) การปรับขนาดการประมวลผล และข้อมูลขนาดอินเทอร์เน็ต — ทั้งสามอย่างพร้อมกัน