อ.ส.ค.: แทนที่รูปแบบการให้รางวัลด้วยการเพิ่มประสิทธิภาพการตั้งค่าโดยตรง

RLHF (ครอบคลุมในบทที่ 2) กำหนดให้มีสามขั้นตอนการฝึกอบรมแยกกัน: SFT → รูปแบบรางวัล → PPO แต่ละเฟสต้องการโครงสร้างพื้นฐานของตัวเอง การปรับแต่งไฮเปอร์พารามิเตอร์ของตัวเอง และแนะนำโหมดความล้มเหลวใหม่ ในปี 2023 Rafailov และคณะ DPO ที่เผยแพร่แล้ว — อัลกอริธึมที่บรรลุเป้าหมายการจัดแนวเดียวกันด้วยขั้นตอนการปรับแต่งขั้นตอนเดียว ไม่มีโมเดลการให้รางวัล และลูปการเรียนรู้มาตรฐานภายใต้การดูแล ขณะนี้เป็นวิธีการจัดแนวที่โดดเด่นในระบบนิเวศโอเพ่นซอร์ส

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.