แบบจำลองให้ผลต่างกันระหว่างกลุ่มและอาจสร้างผลกระทบไม่เป็นธรรม จึงวินิจฉัยว่า ในการประมวลผลข้อมูลชุดใหญ่ที่มีตัวแปร 100 ตัว พบว่ามีตัวแปรบางตัวที่มีความสัมพันธ์สูงมากกับตัวแปรอื่น ควรจัดการอย่างไร
กรวมตัวแปรที่มีความสัมพันธ์สูงไว้เป็นตัวแปรเดียว
ขลบตัวแปรที่มีความสัมพันธ์สูงออกไป เพื่อลดความซับซ้อน
คคัดเลือกตัวแปรที่มีความสัมพันธ์ต่ำกับตัวแปรอื่น เพื่อลดการ multicollinearity
งเก็บตัวแปรทั้งหมด เพราะมีข้อมูลครบ
เฉลยอธิบาย
ตัวแปรที่มีความสัมพันธ์สูงกับตัวแปรอื่น (Multicollinearity) ทำให้การวิเคราะห์ข้อมูลแบบเชิงเส้นมีปัญหา เพราะตัวแปรเหล่านี้ให้ข้อมูลคล้ายกัน การคัดเลือกตัวแปรให้เหลือตัวแปรที่มีความสัมพันธ์ต่ำ (Feature Selection) จึงเป็นวิธีที่ดี ตัวเลือก A อาจทำให้สูญเสียข้อมูลสำคัญ ตัวเลือก D ซับซ้อนและอาจสูญเสียข้อมูล