ระบบ AI ที่ใช้ Reinforcement Learning เพื่อเล่นเกมวางแผนกลยุทธ์ เมื่อนำไปฝึกในสภาพแวดล้อมเกมที่ถูก Simulate และต่อมาพบว่าประสิทธิภาพในสภาพแวดล้อมจริงลดลงอย่างมาก ปัญหานี้เรียกว่าอะไร และสะท้อนข้อจำกัดใดของ Reinforcement Learning
กOverfitting เพราะโมเดลเรียนรู้จาก Training Data มากเกินไป
ขSim-to-Real Gap เพราะสภาพแวดล้อม Simulation ไม่สามารถจำลองความซับซ้อนและความไม่แน่นอนของโลกจริงได้อย่างสมบูรณ์
คExploration-Exploitation Tradeoff เพราะโมเดลเลือก Exploit มากเกินไปในสภาพแวดล้อมจริง
งReward Hacking เพราะโมเดลหาทางได้รับรางวัลโดยไม่ตรงตามวัตถุประสงค์ที่แท้จริง
เฉลยอธิบาย
Sim-to-Real Gap (หรือ Reality Gap) เป็นปัญหาสำคัญใน Reinforcement Learning โดยเฉพาะ Robotics และ Game AI เมื่อโมเดลถูกฝึกใน Simulation ที่ง่ายกว่าความเป็นจริง เช่น ฟิสิกส์ที่ไม่สมบูรณ์ ความล่าช้าของเซนเซอร์ หรือความไม่แน่นอนในสภาพแวดล้อม โมเดลที่ทำงานดีใน Simulation อาจล้มเหลวในสภาพแวดล้อมจริงเพราะ Policy ที่เรียนรู้ไม่ Generalize ได้ดี วิธีแก้ได้แก่ Domain Randomization และ Transfer Learning ตัวเลือก A Overfitting เกี่ยวกับ Data ไม่ใช่ Environment Gap ตัวเลือก C เป็นปัญหาระหว่างการฝึก ไม่ใช่ช่วง Deployment และตัวเลือก D Reward Hacking เป็นปัญหาที่โมเดลโกงระบบรางวัล ไม่ใช่ความแตกต่างระหว่าง Simulation และความเป็นจริง