ผู้วิเคราะห์ต้องเลือกวิธีรับมือข้อมูลไม่สมดุลตามวัตถุประสงค์และต้นทุนความผิดพลาด จึงพิจารณาว่า ในการสร้างแบบจำลอง Machine Learning เพื่อจำแนกประเภทอีเมลเป็น Spam หรือไม่ใช่ Spam หากต้องการจำนวนผลบวกลวง (False Positive) น้อยที่สุด ควรเลือกเกณฑ์ (Threshold) อย่างไร

เพิ่มเกณฑ์เพื่อลดความอ่อนไหวและเพิ่ม Specificity ทำให้ผลบวกลวงน้อยลง
ใช้เกณฑ์ที่กำหนดโดยเครื่องมือวิเคราะห์อัตโนมัติ
ตั้งเกณฑ์ที่ 0.5 เสมอ
ลดเกณฑ์เพื่อเพิ่มความอ่อนไหวของแบบจำลอง

เฉลยอธิบาย

ผลบวกลวง (False Positive) หมายถึงการจำแนกอีเมลทั่วไปว่าเป็น Spam ซึ่งเป็นข้อผิดพลาดที่ร้ายแรง การเพิ่มเกณฑ์ (ตั้งค่าสูงกว่า 0.5) จะทำให้แบบจำลองต้องการความมั่นใจสูงกว่าก่อนจำแนกว่าเป็น Spam ลดความอ่อนไหว (Sensitivity) แต่เพิ่ม Specificity ทำให้ผลบวกลวงลดลง ตัวเลือก A ไม่ประเมินบริบท ตัวเลือก B จะเพิ่มผลบวกลวง ตัวเลือก D ไม่ดี

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับการประมวลผลข้อมูลและวิเคราะห์ข้อมูล

ดูข้อสอบวิชานี้ทั้งหมด →