ข้อมูลมีทั้งตัวเลขและหมวดหมู่ และต้องทำ CV แนวทางใดลดความผิดพลาดเชิงกระบวนการ — หากเปรียบเทียบสองแนวทาง ข้อใดมีเหตุผลรองรับเหมาะสมกว่า
กเลือกข้อเสนอที่ระบุว่า fit preprocessing จากข้อมูลทั้งหมดก่อนเริ่ม CV แล้วใช้คะแนนเฉลี่ยแทนการตรวจ error รายกรณี
ขเลือกข้อเสนอที่ระบุว่า fit encoder ใหม่บน test fold แต่ใช้ scaler จาก train fold โดยไม่กำหนดเงื่อนไขหยุดใช้หรือ rollback
คเลือกแนวทางที่สอดคล้องกับหลักว่า ใช้ ColumnTransformer/Pipeline แยก preprocessing ตามชนิดและ fit ภายในแต่ละ fold
งเลือกข้อเสนอที่ระบุว่า แปลงทั้งตัวเลขและหมวดหมู่ด้วยขั้นตอนเดียวกันเพื่อให้ pipeline สั้น
เฉลยอธิบาย
Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “เลือกแนวทางที่สอดคล้องกับหลักว่า ใช้ ColumnTransformer/Pipeline แยก preprocessing ตามชนิดและ fit ภายในแต่ละ fold” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น