ทำ K-means ด้วยรายได้หน่วยแสนและจำนวนครั้งใช้บริการหน่วยหลักหน่วย ผลใดน่ากังวล — หากเปรียบเทียบสองแนวทาง ข้อใดมีเหตุผลรองรับเหมาะสมกว่า

เลือกแนวทางที่สอดคล้องกับหลักว่า ฟีเจอร์สเกลใหญ่ครอบงำระยะทาง จึงควรพิจารณา scaling และความหมายของระยะทาง
เลือกข้อเสนอที่ระบุว่า ใช้ระยะทางเดิมแล้วเพิ่มจำนวนคลัสเตอร์เพื่อชดเชย และไม่ตรวจความไวของผลต่อสมมติฐานที่ใช้
เลือกข้อเสนอที่ระบุว่า scale เฉพาะฟีเจอร์จำนวนครั้งเพราะมีค่าตัวเลขเล็กกว่า โดยใช้เกณฑ์เดียวตัดสินโดยไม่เทียบ baseline
เลือกข้อเสนอที่ระบุว่า เปลี่ยนค่า k จนได้ silhouette สูงโดยไม่ปรับสเกล และไม่แยกข้อมูลสำหรับประเมินผลสุดท้าย

เฉลยอธิบาย

Clustering: K-means and silhouette evaluation อธิบายว่าการเลือกและประเมินคลัสเตอร์ต้องพิจารณาระยะทาง การปรับสเกล คุณภาพการแบ่งกลุ่ม และความหมายต่อการใช้งาน เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “เลือกแนวทางที่สอดคล้องกับหลักว่า ฟีเจอร์สเกลใหญ่ครอบงำระยะทาง จึงควรพิจารณา scaling และความหมายของระยะทาง” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →