ข้อมูลมีทั้งตัวเลขและหมวดหมู่ และต้องทำ CV แนวทางใดลดความผิดพลาดเชิงกระบวนการ — หากเปรียบเทียบสองแนวทาง ข้อใดมีเหตุผลรองรับเหมาะสมกว่า

เลือกข้อเสนอที่ระบุว่า fit preprocessing จากข้อมูลทั้งหมดก่อนเริ่ม CV แล้วใช้คะแนนเฉลี่ยแทนการตรวจ error รายกรณี
เลือกข้อเสนอที่ระบุว่า fit encoder ใหม่บน test fold แต่ใช้ scaler จาก train fold โดยไม่กำหนดเงื่อนไขหยุดใช้หรือ rollback
เลือกแนวทางที่สอดคล้องกับหลักว่า ใช้ ColumnTransformer/Pipeline แยก preprocessing ตามชนิดและ fit ภายในแต่ละ fold
เลือกข้อเสนอที่ระบุว่า แปลงทั้งตัวเลขและหมวดหมู่ด้วยขั้นตอนเดียวกันเพื่อให้ pipeline สั้น

เฉลยอธิบาย

Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “เลือกแนวทางที่สอดคล้องกับหลักว่า ใช้ ColumnTransformer/Pipeline แยก preprocessing ตามชนิดและ fit ภายในแต่ละ fold” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →
ข้อมูลมีทั้งตัวเลขและหมวดหมู่ และต้องทำ CV แนวทางใดลดความผิดพลาดเชิงกระบวนการ —... | แนวข้อสอบวิทยาการข้อมูล (Data Science) | ติวสอบภาค ข