ก่อนทำ PCA กับฟีเจอร์หน่วยต่างกันมาก ควรพิจารณาอะไร — ข้อสรุปใดสะท้อนเงื่อนไขสำคัญของวิธีการนี้

ทำ PCA บน covariance matrix ของข้อมูลดิบแล้ว scale components ภายหลัง
fit scaler และ PCA จากข้อมูลทั้งหมดก่อนแบ่ง train/test แล้วสรุปจากการทดลองเพียงรอบเดียว
scale เฉพาะฟีเจอร์ที่มี variance ต่ำกว่าค่าเฉลี่ย โดยไม่ทดสอบผลเมื่อ distribution เปลี่ยน
standardization เพราะองค์ประกอบหลักอาจถูกครอบงำด้วยฟีเจอร์ variance สูงจากหน่วยวัด

เฉลยอธิบาย

Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “standardization เพราะองค์ประกอบหลักอาจถูกครอบงำด้วยฟีเจอร์ variance สูงจากหน่วยวัด” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →