ก่อนยอมรับโมเดลซับซ้อน ควรเปรียบเทียบกับอะไร — การออกแบบกระบวนการแบบใดตอบโจทย์นี้ได้เหมาะสม

เปรียบเทียบคะแนน train ของโมเดลซับซ้อนกับ validation ของโมเดลง่าย
ใช้คะแนนจากชุดข้อมูลสาธารณะที่มี target คล้ายกัน แล้วสรุปจากการทดลองเพียงรอบเดียว
เลือก baseline ที่มีจำนวนฟีเจอร์เท่ากันแต่ไม่จำลองกฎธุรกิจเดิม
baseline ง่ายที่สอดคล้องงาน เช่น Dummy estimator และกฎธุรกิจเดิม

เฉลยอธิบาย

Model selection and evaluation อธิบายว่าการเลือกโมเดล เมตริก threshold และวิธี cross-validation ต้องสอดคล้องกับชนิดข้อมูล ต้นทุนความผิดพลาด และการใช้งานจริง เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “baseline ง่ายที่สอดคล้องงาน เช่น Dummy estimator และกฎธุรกิจเดิม” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →