ก่อนทำ PCA กับฟีเจอร์หน่วยต่างกันมาก ควรพิจารณาอะไร — เมื่อทีมต้องแก้ความเสี่ยง ขั้นตอนใดควรทำต่อ

ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า ทำ PCA บน covariance matrix ของข้อมูลดิบแล้ว scale components ภายหลัง
ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า fit scaler และ PCA จากข้อมูลทั้งหมดก่อนแบ่ง train/test โดยไม่กำหนดเงื่อนไขหยุดใช้หรือ rollback
ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า standardization เพราะองค์ประกอบหลักอาจถูกครอบงำด้วยฟีเจอร์ variance สูงจากหน่วยวัด
ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า scale เฉพาะฟีเจอร์ที่มี variance ต่ำกว่าค่าเฉลี่ย และไม่ตรวจว่าสมมติฐานของวิธีตรงกับข้อมูล

เฉลยอธิบาย

Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “ขั้นตอนถัดไปคือดำเนินการตามแนวทางว่า standardization เพราะองค์ประกอบหลักอาจถูกครอบงำด้วยฟีเจอร์ variance สูงจากหน่วยวัด” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →