คอลัมน์ตัวเลขมีค่าหายและจะทำ cross-validation ควรเติมค่าอย่างไร — จุดบกพร่องใดของกระบวนการควรถูกระบุก่อน
กระบุว่าปัญหาคือ คำนวณ median จากข้อมูลทั้งหมดก่อนเริ่ม CV แล้วใช้คะแนนเฉลี่ยแทนการตรวจ error รายกรณี
ขระบุว่าปัญหาคือ เรียนรู้ค่าเติมจาก train และ test fold แยกกัน โดยไม่กำหนดเงื่อนไขหยุดใช้หรือ rollback
คระบุว่ากระบวนการยังไม่ยึดหลักว่า ใส่ imputer ใน pipeline เพื่อให้แต่ละ fold เรียนรู้ค่าจาก train fold
งระบุว่าปัญหาคือ เลือกวิธีเติมที่ให้คะแนน CV สูงที่สุดหลังทดลองกับทุก fold เดิม
เฉลยอธิบาย
Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “ระบุว่ากระบวนการยังไม่ยึดหลักว่า ใส่ imputer ใน pipeline เพื่อให้แต่ละ fold เรียนรู้ค่าจาก train fold” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น