เทคนิค RLHF (Reinforcement Learning from Human Feedback) ที่ใช้ในการพัฒนาโมเดลภาษาขนาดใหญ่ (LLM) มีหลักการทำงานและข้อจำกัดตรงกับข้อใด
กRLHF ใช้ผู้ประเมินมนุษย์ให้คะแนนผลลัพธ์ของโมเดลเพื่อฝึก Reward Model แล้วนำไปปรับโมเดลหลัก แต่มีข้อจำกัดคือความเห็นของผู้ประเมินอาจมีอคติและกระบวนการมีต้นทุนสูง
ขRLHF ใช้การเรียนรู้แบบไม่มีผู้สอน (Unsupervised Learning) เพื่อให้โมเดลค้นพบรูปแบบภาษาได้เอง โดยไม่ต้องอาศัยข้อมูลจากมนุษย์ ทำให้ประหยัดต้นทุนในการพัฒนา
คRLHF เป็นเทคนิคที่ใช้เฉพาะในขั้นตอน Pre-training เพื่อให้โมเดลเรียนรู้ข้อมูลขนาดใหญ่ได้เร็วขึ้น โดยไม่เกี่ยวข้องกับการปรับพฤติกรรมของโมเดลในภายหลัง
งRLHF ใช้อัลกอริทึมเสริมแรง (Reinforcement Learning) ล้วนๆ โดยกำหนดรางวัลจากกฎตายตัวที่ตั้งไว้ล่วงหน้า ทำให้โมเดลมีความสม่ำเสมอและลดอคติจากมนุษย์ได้อย่างสมบูรณ์
เฉลยอธิบาย
RLHF (Reinforcement Learning from Human Feedback) คือกระบวนการที่ให้มนุษย์ประเมินและจัดอันดับผลลัพธ์ของโมเดล จากนั้นนำข้อมูลดังกล่าวมาฝึก Reward Model และใช้ Reward Model นั้นเพื่อปรับปรุงโมเดลภาษาหลักผ่านการเรียนรู้แบบเสริมแรง ข้อจำกัดสำคัญคืออคติของผู้ประเมิน (Human Bias) ต้นทุนสูงในการจ้างผู้ประเมิน และความไม่สอดคล้องของเกณฑ์การประเมิน ตัวเลือก B ผิดเพราะ RLHF ต้องอาศัยมนุษย์ ตัวเลือก C ผิดเพราะ RLHF ใช้ในขั้น Fine-tuning ไม่ใช่ Pre-training และตัวเลือก D ผิดเพราะ RLHF ต้องการข้อมูลจากมนุษย์ไม่ใช่กฎตายตัว