ต้องให้ทีมอื่นทำผลทดลองซ้ำได้ ควรบันทึกอะไร — การออกแบบกระบวนการแบบใดตอบโจทย์นี้ได้เหมาะสม
กบันทึกเฉพาะเวอร์ชันโค้ดกับ random seed โดยไม่รายงานช่วงความไม่แน่นอนของผล
ขข้อมูล/เวอร์ชันโค้ด สภาพแวดล้อม split seed พารามิเตอร์ และขั้นตอน preprocessing
คเก็บเฉพาะไฟล์โมเดลและคะแนนเฉลี่ยจาก validation และไม่ตรวจผลกระทบต่อกลุ่มย่อย
งระบุชื่ออัลกอริทึมกับพารามิเตอร์โดยไม่เก็บเวอร์ชันข้อมูล โดยไม่ทวนสอบกับข้อมูลจากช่วงเวลาใหม่
เฉลยอธิบาย
Common pitfalls: inconsistent preprocessing, leakage and randomness อธิบายว่าต้องแยกข้อมูลก่อนเรียนรู้ preprocessing ใช้ pipeline ให้ขั้นตอนถูก fit เฉพาะข้อมูลฝึก และควบคุมแหล่งสุ่มเพื่อทำซ้ำได้ เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “ข้อมูล/เวอร์ชันโค้ด สภาพแวดล้อม split seed พารามิเตอร์ และขั้นตอน preprocessing” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น