นักวิเคราะห์ต้องเลือกวิธีที่ตอบคำถามและสอดคล้องกับคุณสมบัติข้อมูล จึงพิจารณาว่า ในการวิเคราะห์ข้อมูลขนาดใหญ่ (Big Data) ด้วยเทคนิก Data Mining แนวทางใดที่ช่วยลดปัญหาการ Overfitting ได้มากที่สุด?

การใช้ขนาดตัวอย่างที่เล็กมากเพื่อให้โมเดลเรียนรู้เร็วขึ้น
การเพิ่มจำนวนตัวแปรทำนายให้มากขึ้นเพื่อให้โมเดลมีความซับซ้อนมากขึ้น
การแบ่งข้อมูลออกเป็นชุดฝึกสอน (Training Set) ชุดทดสอบ (Test Set) และชุดตรวจสอบ (Validation Set)
การลบข้อมูลที่มีค่าผิดปกติออกจากชุดข้อมูลทั้งหมด

เฉลยอธิบาย

การแบ่งข้อมูลออกเป็น 3 ชุด (Training, Test, Validation) เป็นวิธีมาตรฐานในการควบคุม Overfitting เพราะช่วยให้สามารถตรวจสอบประสิทธิภาพของโมเดลบนข้อมูลที่ไม่เคยเห็นมาก่อน

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับการประมวลผลข้อมูลและวิเคราะห์ข้อมูล

ดูข้อสอบวิชานี้ทั้งหมด →