นักพัฒนาสร้างโมเดลจำแนกอีเมลขยะ (Spam Detection) โดยพบว่าใน Dataset มีอีเมลปกติ 95% และ Spam 5% โมเดลที่ฝึกแล้วทำนาย 'ไม่ใช่ Spam' ทุกอีเมล ได้ Accuracy 95% ปัญหาสำคัญที่สุดในกรณีนี้คืออะไร

โมเดลไม่สามารถตรวจจับ Spam ได้เลย เนื่องจาก Class Imbalance ทำให้ค่า Accuracy สูงแต่ไม่มีประโยชน์จริง
Dataset มีขนาดเล็กเกินไป ทำให้โมเดลเกิด Overfitting และไม่สามารถ Generalize ได้กับข้อมูลใหม่
โมเดลใช้ Algorithm ที่ซับซ้อนเกินไป ทำให้เกิด High Variance และต้องการการ Regularization เพิ่มเติม
Feature Extraction ไม่มีประสิทธิภาพ ทำให้โมเดลไม่สามารถแยกแยะลักษณะของ Spam ออกจากอีเมลปกติได้

เฉลยอธิบาย

ปัญหาหลักคือ Class Imbalance (ข้อมูลไม่สมดุล) โมเดลเรียนรู้ที่จะทำนาย 'ไม่ใช่ Spam' ทุกอีเมล จึงได้ Accuracy 95% โดยไม่ต้องเรียนรู้อะไรจริง ๆ ค่า Accuracy จึงเป็นตัวชี้วัดที่หลอกลวงในกรณีนี้ ควรใช้ตัวชี้วัดอื่น เช่น Precision, Recall, F1-Score หรือ AUC-ROC แทน เพื่อสะท้อนประสิทธิภาพที่แท้จริงของโมเดลในการตรวจจับ Spam

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับปัญญาประดิษฐ์ (AI) และเทคโนโลยีดิจิทัล

ดูข้อสอบวิชานี้ทั้งหมด →