silhouette สูงมาก แต่คลัสเตอร์แบ่งตามรหัสสาขาที่ไม่เกี่ยวกับเป้าหมาย ควรสรุปอย่างไร — จุดบกพร่องใดของกระบวนการควรถูกระบุก่อน

ระบุว่าปัญหาคือ ยอมรับผลเพราะ silhouette วัดคุณภาพคลัสเตอร์โดยตรง โดยไม่รายงานช่วงความไม่แน่นอนของผล
ระบุว่ากระบวนการยังไม่ยึดหลักว่า โครงสร้างแยกได้ทางคณิตศาสตร์แต่ต้องตรวจความหมายและการใช้งานก่อนยอมรับ
ระบุว่าปัญหาคือ เพิ่ม k เพื่อให้แต่ละสาขาถูกแบ่งละเอียดขึ้น และไม่ตรวจผลกระทบต่อกลุ่มย่อย
ระบุว่าปัญหาคือ ลบรหัสสาขาหลัง clustering แล้วใช้ assignment เดิมต่อ โดยไม่ทวนสอบกับข้อมูลจากช่วงเวลาใหม่

เฉลยอธิบาย

Clustering: K-means and silhouette evaluation อธิบายว่าการเลือกและประเมินคลัสเตอร์ต้องพิจารณาระยะทาง การปรับสเกล คุณภาพการแบ่งกลุ่ม และความหมายต่อการใช้งาน เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “ระบุว่ากระบวนการยังไม่ยึดหลักว่า โครงสร้างแยกได้ทางคณิตศาสตร์แต่ต้องตรวจความหมายและการใช้งานก่อนยอมรับ” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →