ทีมเติมค่าที่หายด้วยค่าเฉลี่ยจากข้อมูลทั้งหมดก่อนแบ่ง train/test ข้อใดเหมาะสมที่สุด — เมื่อทีมต้องแก้ความเสี่ยง ขั้นตอนใดควรทำต่อ

ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า ใช้ค่าเฉลี่ยทั้งชุดแล้วค่อยแบ่งเพราะได้ค่าประมาณเสถียรกว่า
ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า เติมค่า train และ test แยกกันจากสถิติของแต่ละชุด
ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า เลือกค่าเติมจากวิธีที่ให้คะแนน test สูงที่สุด
ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า แบ่งข้อมูลก่อน แล้วเรียนรู้ค่าเติมจาก train ภายใน pipeline

เฉลยอธิบาย

Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า แบ่งข้อมูลก่อน แล้วเรียนรู้ค่าเติมจาก train ภายใน pipeline” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →