ใช้โมเดลที่อาศัยระยะทางกับฟีเจอร์หน่วยต่างกันมาก ควรทำอย่างไร — จากผลที่รายงาน ผู้กำกับดูแลควรสรุปหลักอย่างไร

สรุปว่า fit scaler แยกบน train และข้อมูลใหม่แต่ละชุด โดยไม่รายงานช่วงความไม่แน่นอนของผล
สรุปว่า fit scaler จาก train ภายใน pipeline แล้วใช้ transformation เดียวกันกับข้อมูลใหม่
สรุปว่า fit scaler จาก train รวม test เพื่อให้ครอบคลุมช่วงค่า และไม่ตรวจผลกระทบต่อกลุ่มย่อย
สรุปว่า scale เฉพาะ target แล้วใช้ฟีเจอร์ในหน่วยเดิม โดยไม่ทวนสอบกับข้อมูลจากช่วงเวลาใหม่

เฉลยอธิบาย

Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “สรุปว่า fit scaler จาก train ภายใน pipeline แล้วใช้ transformation เดียวกันกับข้อมูลใหม่” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →