อ.ส.ค.: แทนที่รูปแบบการให้รางวัลด้วยการเพิ่มประสิทธิภาพการตั้งค่าโดยตรง
RLHF (ครอบคลุมในบทที่ 2) กำหนดให้มีสามขั้นตอนการฝึกอบรมแยกกัน: SFT → รูปแบบรางวัล → PPO แต่ละเฟสต้องการโครงสร้างพื้นฐานของตัวเอง การปรับแต่งไฮเปอร์พารามิเตอร์ของตัวเอง และแนะนำโหมดความล้มเหลวใหม่ ในปี 2023 Rafailov และคณะ DPO ที่เผยแพร่แล้ว — อัลกอริธึมที่บรรลุเป้าหมายการจัดแนวเดียวกันด้วยขั้นตอนการปรับแต่งขั้นตอนเดียว ไม่มีโมเดลการให้รางวัล และลูปการเรียนรู้มาตรฐานภายใต้การดูแล ขณะนี้เป็นวิธีการจัดแนวที่โดดเด่นในระบบนิเวศโอเพ่นซอร์ส