ข้อมูลมีทั้งตัวเลขและหมวดหมู่ และต้องทำ CV แนวทางใดลดความผิดพลาดเชิงกระบวนการ — จุดบกพร่องใดของกระบวนการควรถูกระบุก่อน
กระบุว่าปัญหาคือ fit preprocessing จากข้อมูลทั้งหมดก่อนเริ่ม CV แล้วใช้คะแนนเฉลี่ยแทนการตรวจ error รายกรณี
ขระบุว่าปัญหาคือ fit encoder ใหม่บน test fold แต่ใช้ scaler จาก train fold โดยไม่กำหนดเงื่อนไขหยุดใช้หรือ rollback
คระบุว่ากระบวนการยังไม่ยึดหลักว่า ใช้ ColumnTransformer/Pipeline แยก preprocessing ตามชนิดและ fit ภายในแต่ละ fold
งระบุว่าปัญหาคือ แปลงทั้งตัวเลขและหมวดหมู่ด้วยขั้นตอนเดียวกันเพื่อให้ pipeline สั้น และไม่ตรวจว่าสมมติฐานของวิธีตรงกับข้อมูล
เฉลยอธิบาย
Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “ระบุว่ากระบวนการยังไม่ยึดหลักว่า ใช้ ColumnTransformer/Pipeline แยก preprocessing ตามชนิดและ fit ภายในแต่ละ fold” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น