นักพัฒนาสร้างโมเดลจำแนกอีเมลขยะ (Spam Detection) โดยพบว่าใน Dataset มีอีเมลปกติ 95% และ Spam 5% โมเดลที่ฝึกแล้วทำนาย 'ไม่ใช่ Spam' ทุกอีเมล ได้ Accuracy 95% ปัญหาสำคัญที่สุดในกรณีนี้คืออะไร
กโมเดลไม่สามารถตรวจจับ Spam ได้เลย เนื่องจาก Class Imbalance ทำให้ค่า Accuracy สูงแต่ไม่มีประโยชน์จริง
ขDataset มีขนาดเล็กเกินไป ทำให้โมเดลเกิด Overfitting และไม่สามารถ Generalize ได้กับข้อมูลใหม่
คโมเดลใช้ Algorithm ที่ซับซ้อนเกินไป ทำให้เกิด High Variance และต้องการการ Regularization เพิ่มเติม
งFeature Extraction ไม่มีประสิทธิภาพ ทำให้โมเดลไม่สามารถแยกแยะลักษณะของ Spam ออกจากอีเมลปกติได้
เฉลยอธิบาย
ปัญหาหลักคือ Class Imbalance (ข้อมูลไม่สมดุล) โมเดลเรียนรู้ที่จะทำนาย 'ไม่ใช่ Spam' ทุกอีเมล จึงได้ Accuracy 95% โดยไม่ต้องเรียนรู้อะไรจริง ๆ ค่า Accuracy จึงเป็นตัวชี้วัดที่หลอกลวงในกรณีนี้ ควรใช้ตัวชี้วัดอื่น เช่น Precision, Recall, F1-Score หรือ AUC-ROC แทน เพื่อสะท้อนประสิทธิภาพที่แท้จริงของโมเดลในการตรวจจับ Spam