เมื่อเทรนโมเดลแมชชีนเลิร์นนิง เหตุใดจึงต้องแบ่งข้อมูลออกเป็นชุด Training, Validation และ Test
กเพื่อให้โมเดลเรียนรู้จากข้อมูล Training ปรับแต่ง Hyperparameter ด้วย Validation และประเมินประสิทธิภาพจริงด้วย Test โดยไม่ให้ข้อมูลรั่วไหลระหว่างขั้นตอน
ขเพื่อให้โมเดลสามารถใช้ข้อมูลทุกชุดในการเรียนรู้พร้อมกัน และเพิ่มความแม่นยำของการทำนายได้มากที่สุดโดยไม่เกิด Overfitting
คเพื่อลดขนาดของชุดข้อมูลให้เล็กลง ทำให้ใช้ทรัพยากรการประมวลผลน้อยลงและโมเดลทำงานได้เร็วขึ้นในการนำไปใช้งานจริง
งเพื่อให้โมเดลจดจำข้อมูล Training ได้ครบถ้วน แล้วใช้ Validation และ Test ในการเพิ่มข้อมูลใหม่ให้โมเดลเรียนรู้เพิ่มเติมได้ต่อเนื่อง
เฉลยอธิบาย
การแบ่งข้อมูลเป็น 3 ชุด มีวัตถุประสงค์ที่แตกต่างกันชัดเจน คือ Training ใช้สอนโมเดล, Validation ใช้ปรับแต่ง Hyperparameter และตรวจสอบว่าโมเดล Overfit หรือไม่ระหว่างการพัฒนา และ Test ใช้ประเมินประสิทธิภาพขั้นสุดท้ายบนข้อมูลที่โมเดลไม่เคยเห็นมาก่อน เพื่อให้ผลการประเมินสะท้อนความสามารถจริงในการนำไปใช้งาน