คอลัมน์ตัวเลขมีค่าหายและจะทำ cross-validation ควรเติมค่าอย่างไร — หากเปรียบเทียบสองแนวทาง ข้อใดมีเหตุผลรองรับเหมาะสมกว่า

เลือกข้อเสนอที่ระบุว่า คำนวณ median จากข้อมูลทั้งหมดก่อนเริ่ม CV โดยไม่เปรียบเทียบกับวิธีง่ายที่กำหนดไว้
เลือกข้อเสนอที่ระบุว่า เรียนรู้ค่าเติมจาก train และ test fold แยกกัน แล้วสรุปจากการทดลองเพียงรอบเดียว
เลือกข้อเสนอที่ระบุว่า เลือกวิธีเติมที่ให้คะแนน CV สูงที่สุดหลังทดลองกับทุก fold เดิม
เลือกแนวทางที่สอดคล้องกับหลักว่า ใส่ imputer ใน pipeline เพื่อให้แต่ละ fold เรียนรู้ค่าจาก train fold

เฉลยอธิบาย

Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “เลือกแนวทางที่สอดคล้องกับหลักว่า ใส่ imputer ใน pipeline เพื่อให้แต่ละ fold เรียนรู้ค่าจาก train fold” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →