ระบบ AI ที่ใช้ Reinforcement Learning เพื่อเล่นเกมวางแผนกลยุทธ์ เมื่อนำไปฝึกในสภาพแวดล้อมเกมที่ถูก Simulate และต่อมาพบว่าประสิทธิภาพในสภาพแวดล้อมจริงลดลงอย่างมาก ปัญหานี้เรียกว่าอะไร และสะท้อนข้อจำกัดใดของ Reinforcement Learning

Overfitting เพราะโมเดลเรียนรู้จาก Training Data มากเกินไป
Sim-to-Real Gap เพราะสภาพแวดล้อม Simulation ไม่สามารถจำลองความซับซ้อนและความไม่แน่นอนของโลกจริงได้อย่างสมบูรณ์
Exploration-Exploitation Tradeoff เพราะโมเดลเลือก Exploit มากเกินไปในสภาพแวดล้อมจริง
Reward Hacking เพราะโมเดลหาทางได้รับรางวัลโดยไม่ตรงตามวัตถุประสงค์ที่แท้จริง

เฉลยอธิบาย

Sim-to-Real Gap (หรือ Reality Gap) เป็นปัญหาสำคัญใน Reinforcement Learning โดยเฉพาะ Robotics และ Game AI เมื่อโมเดลถูกฝึกใน Simulation ที่ง่ายกว่าความเป็นจริง เช่น ฟิสิกส์ที่ไม่สมบูรณ์ ความล่าช้าของเซนเซอร์ หรือความไม่แน่นอนในสภาพแวดล้อม โมเดลที่ทำงานดีใน Simulation อาจล้มเหลวในสภาพแวดล้อมจริงเพราะ Policy ที่เรียนรู้ไม่ Generalize ได้ดี วิธีแก้ได้แก่ Domain Randomization และ Transfer Learning ตัวเลือก A Overfitting เกี่ยวกับ Data ไม่ใช่ Environment Gap ตัวเลือก C เป็นปัญหาระหว่างการฝึก ไม่ใช่ช่วง Deployment และตัวเลือก D Reward Hacking เป็นปัญหาที่โมเดลโกงระบบรางวัล ไม่ใช่ความแตกต่างระหว่าง Simulation และความเป็นจริง

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับปัญญาประดิษฐ์ (AI) และเทคโนโลยีดิจิทัล

ดูข้อสอบวิชานี้ทั้งหมด →