คอลัมน์ตัวเลขมีค่าหายและจะทำ cross-validation ควรเติมค่าอย่างไร — จุดบกพร่องใดของกระบวนการควรถูกระบุก่อน

ระบุว่าปัญหาคือ คำนวณ median จากข้อมูลทั้งหมดก่อนเริ่ม CV แล้วใช้คะแนนเฉลี่ยแทนการตรวจ error รายกรณี
ระบุว่าปัญหาคือ เรียนรู้ค่าเติมจาก train และ test fold แยกกัน โดยไม่กำหนดเงื่อนไขหยุดใช้หรือ rollback
ระบุว่ากระบวนการยังไม่ยึดหลักว่า ใส่ imputer ใน pipeline เพื่อให้แต่ละ fold เรียนรู้ค่าจาก train fold
ระบุว่าปัญหาคือ เลือกวิธีเติมที่ให้คะแนน CV สูงที่สุดหลังทดลองกับทุก fold เดิม

เฉลยอธิบาย

Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “ระบุว่ากระบวนการยังไม่ยึดหลักว่า ใส่ imputer ใน pipeline เพื่อให้แต่ละ fold เรียนรู้ค่าจาก train fold” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →