รายงานพบความสัมพันธ์ระหว่างสองตัวแปรแต่ยังสรุปเหตุและผลไม่ได้ จึงพิจารณาว่า ในการจัดการข้อมูลอันไม่สมดุล (Imbalanced Data) เช่น ข้อมูล 99% ที่ไม่มีความผิดปกติ และ 1% ที่มีความผิดปกติ ควรใช้วิธีใด

ใช้เมตริก Precision เพียงอย่างเดียว
ลบข้อมูลส่วนใหญ่ (99%) เหลือเพียง ข้อมูลที่มีความผิดปกติ
ใช้เทคนิค Over-sampling, Under-sampling หรือ Synthetic Data Generation (SMOTE)
ใช้ข้อมูลทั้งหมด และฝึกอบรมแบบจำลองด้วยเมตริก Accuracy

เฉลยอธิบาย

เมื่อข้อมูลไม่สมดุล จะทำให้แบบจำลองมีอคติต่อคลาสส่วนใหญ่ วิธีการที่ดีคือ Over-sampling (เพิ่มข้อมูลน้อย) Under-sampling (ลดข้อมูลมาก) หรือ SMOTE (สร้างข้อมูลเทียม) ตัวเลือก A จะได้แบบจำลองที่ไม่ดี เพราะ Accuracy สูงแม้ว่าแบบจำลองจะไม่รู้จักคลาสน้อย ตัวเลือก B สูญเสียข้อมูล ตัวเลือก D ใช้เมตริกเพียงตัวเดียวซึ่งไม่เพียงพอ

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับการประมวลผลข้อมูลและวิเคราะห์ข้อมูล

ดูข้อสอบวิชานี้ทั้งหมด →