ในการพัฒนา Large Language Model (LLM) กระบวนการ Reinforcement Learning from Human Feedback (RLHF) มีบทบาทหลักในขั้นตอนใด

ปรับพฤติกรรมของโมเดลให้สอดคล้องกับความต้องการและค่านิยมของมนุษย์โดยใช้ผลตอบรับจากผู้ใช้งาน
เพิ่มขนาดของชุดข้อมูลฝึกสอนให้ครอบคลุมภาษาและวัฒนธรรมที่หลากหลายมากยิ่งขึ้น
ลดการใช้พลังงานในการประมวลผลของโมเดลขนาดใหญ่ให้มีประสิทธิภาพมากขึ้น
แปลงโครงสร้างโมเดล Transformer ให้รองรับการประมวลผลแบบขนานบนหน่วยความจำที่จำกัด

เฉลยอธิบาย

RLHF (Reinforcement Learning from Human Feedback) เป็นกระบวนการที่ใช้หลังการฝึกสอนเบื้องต้น (pre-training) โดยให้มนุษย์ประเมินผลลัพธ์ของโมเดลและนำข้อมูลผลตอบรับนั้นมาฝึกสอนโมเดล Reward Model จากนั้นใช้เทคนิค Reinforcement Learning ปรับพฤติกรรมของโมเดลให้ตอบสนองได้อย่างปลอดภัย มีประโยชน์ และสอดคล้องกับค่านิยมของมนุษย์ (Alignment) ซึ่งเป็นหัวใจสำคัญของการพัฒนา LLM เช่น ChatGPT

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับปัญญาประดิษฐ์ (AI) และเทคโนโลยีดิจิทัล

ดูข้อสอบวิชานี้ทั้งหมด →