ธนาคารกำลังสร้างระบบประเมินความเสี่ยงสินเชื่อ: ข้อมูลมีทั้งตัวเลขและหมวดหมู่ และต้องทำ CV แนวทางใดลดความผิดพลาดเชิงกระบวนการ
กทำ preprocessing เฉพาะ test
ขแปลงทุกคอลัมน์ด้วยค่าเฉลี่ยรวมก่อน
คใช้ ColumnTransformer/Pipeline แยก preprocessing ตามชนิดและ fit ภายในแต่ละ fold
งคัดฟีเจอร์จากข้อมูลทั้งหมด
เฉลยอธิบาย
composite pipeline ทำให้ preprocessing สอดคล้องและป้องกันการเรียนรู้ข้อมูล validation/test ตัวเลือกอื่นละเลยลำดับเวลา การแยกข้อมูล ความหมายทางสถิติ หรือผลกระทบในการใช้งานจริง แหล่งอ้างอิงทางการ: https://scikit-learn.org/stable/modules/compose.html