คอลัมน์ตัวเลขมีค่าหายและจะทำ cross-validation ควรเติมค่าอย่างไร — จากผลที่รายงาน ผู้กำกับดูแลควรสรุปหลักอย่างไร

สรุปว่า ใส่ imputer ใน pipeline เพื่อให้แต่ละ fold เรียนรู้ค่าจาก train fold
สรุปว่า คำนวณ median จากข้อมูลทั้งหมดก่อนเริ่ม CV และไม่ตรวจความไวของผลต่อสมมติฐานที่ใช้
สรุปว่า เรียนรู้ค่าเติมจาก train และ test fold แยกกัน โดยใช้เกณฑ์เดียวตัดสินโดยไม่เทียบ baseline
สรุปว่า เลือกวิธีเติมที่ให้คะแนน CV สูงที่สุดหลังทดลองกับทุก fold เดิม

เฉลยอธิบาย

Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “สรุปว่า ใส่ imputer ใน pipeline เพื่อให้แต่ละ fold เรียนรู้ค่าจาก train fold” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →