ต้องให้ทีมอื่นทำผลทดลองซ้ำได้ ควรบันทึกอะไร — การออกแบบกระบวนการแบบใดตอบโจทย์นี้ได้เหมาะสม

บันทึกเฉพาะเวอร์ชันโค้ดกับ random seed โดยไม่รายงานช่วงความไม่แน่นอนของผล
ข้อมูล/เวอร์ชันโค้ด สภาพแวดล้อม split seed พารามิเตอร์ และขั้นตอน preprocessing
เก็บเฉพาะไฟล์โมเดลและคะแนนเฉลี่ยจาก validation และไม่ตรวจผลกระทบต่อกลุ่มย่อย
ระบุชื่ออัลกอริทึมกับพารามิเตอร์โดยไม่เก็บเวอร์ชันข้อมูล โดยไม่ทวนสอบกับข้อมูลจากช่วงเวลาใหม่

เฉลยอธิบาย

Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “ข้อมูล/เวอร์ชันโค้ด สภาพแวดล้อม split seed พารามิเตอร์ และขั้นตอน preprocessing” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น

ข้อสอบอื่นในวิชาวิทยาการข้อมูล (Data Science)

ดูข้อสอบวิชานี้ทั้งหมด →