ความสนใจที่มีประสิทธิภาพ: Flash Attention, RoPE และบริบทที่ยาว
กลไกการเอาใจใส่ตนเองของ Transformer คือสิ่งที่ทำให้ LLM มีประสิทธิภาพมาก — โทเค็นทุกตัวสามารถเข้าร่วมกับโทเค็นอื่นๆ ทุกโทเค็นในบริบทได้ แต่มีราคา: เมทริกซ์ความสนใจจะเพิ่มขึ้นตาม กำลังสอง ของความยาวของลำดับ การเพิ่มหน้าต่างบริบทเป็นสองเท่าไม่ได้ทำให้ต้นทุนเพิ่มขึ้นเป็นสองเท่า แต่จะเพิ่มเป็นสี่เท่า บทเรียนนี้ครอบคลุมถึงความก้าวหน้าทางวิศวกรรมที่ทำให้หน้าต่างบริบทโทเค็น 128K และ 1M ใช้งานได้จริง