รายงานพบความสัมพันธ์ระหว่างสองตัวแปรแต่ยังสรุปเหตุและผลไม่ได้ จึงพิจารณาว่า ในการจัดการข้อมูลอันไม่สมดุล (Imbalanced Data) เช่น ข้อมูล 99% ที่ไม่มีความผิดปกติ และ 1% ที่มีความผิดปกติ ควรใช้วิธีใด
กใช้เมตริก Precision เพียงอย่างเดียว
ขลบข้อมูลส่วนใหญ่ (99%) เหลือเพียง ข้อมูลที่มีความผิดปกติ
คใช้เทคนิค Over-sampling, Under-sampling หรือ Synthetic Data Generation (SMOTE)
งใช้ข้อมูลทั้งหมด และฝึกอบรมแบบจำลองด้วยเมตริก Accuracy
เฉลยอธิบาย
เมื่อข้อมูลไม่สมดุล จะทำให้แบบจำลองมีอคติต่อคลาสส่วนใหญ่ วิธีการที่ดีคือ Over-sampling (เพิ่มข้อมูลน้อย) Under-sampling (ลดข้อมูลมาก) หรือ SMOTE (สร้างข้อมูลเทียม) ตัวเลือก A จะได้แบบจำลองที่ไม่ดี เพราะ Accuracy สูงแม้ว่าแบบจำลองจะไม่รู้จักคลาสน้อย ตัวเลือก B สูญเสียข้อมูล ตัวเลือก D ใช้เมตริกเพียงตัวเดียวซึ่งไม่เพียงพอ