ผู้วิเคราะห์ต้องเลือกวิธีรับมือข้อมูลไม่สมดุลตามวัตถุประสงค์และต้นทุนความผิดพลาด จึงพิจารณาว่า ในการสร้างแบบจำลอง Machine Learning เพื่อจำแนกประเภทอีเมลเป็น Spam หรือไม่ใช่ Spam หากต้องการจำนวนผลบวกลวง (False Positive) น้อยที่สุด ควรเลือกเกณฑ์ (Threshold) อย่างไร
กเพิ่มเกณฑ์เพื่อลดความอ่อนไหวและเพิ่ม Specificity ทำให้ผลบวกลวงน้อยลง
ขใช้เกณฑ์ที่กำหนดโดยเครื่องมือวิเคราะห์อัตโนมัติ
คตั้งเกณฑ์ที่ 0.5 เสมอ
งลดเกณฑ์เพื่อเพิ่มความอ่อนไหวของแบบจำลอง
เฉลยอธิบาย
ผลบวกลวง (False Positive) หมายถึงการจำแนกอีเมลทั่วไปว่าเป็น Spam ซึ่งเป็นข้อผิดพลาดที่ร้ายแรง การเพิ่มเกณฑ์ (ตั้งค่าสูงกว่า 0.5) จะทำให้แบบจำลองต้องการความมั่นใจสูงกว่าก่อนจำแนกว่าเป็น Spam ลดความอ่อนไหว (Sensitivity) แต่เพิ่ม Specificity ทำให้ผลบวกลวงลดลง ตัวเลือก A ไม่ประเมินบริบท ตัวเลือก B จะเพิ่มผลบวกลวง ตัวเลือก D ไม่ดี