ตารางหลักควรมีหนึ่งแถวต่อรหัส แต่พบรหัสซ้ำก่อน merge ควรทำอย่างไร — หากเปรียบเทียบสองแนวทาง ข้อใดมีเหตุผลรองรับเหมาะสมกว่า
กเลือกข้อเสนอที่ระบุว่า เก็บแถวแรกของแต่ละรหัสโดยไม่ตรวจความหมายของข้อมูลซ้ำ โดยไม่เปรียบเทียบกับวิธีง่ายที่กำหนดไว้
ขเลือกข้อเสนอที่ระบุว่า รวมค่าทุกคอลัมน์ด้วยค่าเฉลี่ยก่อนทราบสาเหตุของการซ้ำ แล้วสรุปจากการทดลองเพียงรอบเดียว
คเลือกข้อเสนอที่ระบุว่า อนุญาต many-to-many merge แล้วลบแถวซ้ำจากผลลัพธ์ โดยไม่ทดสอบผลเมื่อ distribution เปลี่ยน
งเลือกแนวทางที่สอดคล้องกับหลักว่า ค้นหาสาเหตุ กำหนดกฎ deduplicate/aggregate และยืนยันเอกลักษณ์ก่อน merge
เฉลยอธิบาย
pandas.merge: validate and join cardinality อธิบายว่าการ merge ควรตรวจความเป็นเอกลักษณ์ของคีย์และใช้ validate ให้ตรงกับความสัมพันธ์ที่คาด เมื่อนำมาใช้กับโจทย์จึงต้องเลือก “เลือกแนวทางที่สอดคล้องกับหลักว่า ค้นหาสาเหตุ กำหนดกฎ deduplicate/aggregate และยืนยันเอกลักษณ์ก่อน merge” ส่วนตัวเลือกอื่นใช้ข้อมูลผิดช่วง เลือกเมตริกไม่ตรงเป้าหมาย หรือข้ามการตรวจผลกระทบที่จำเป็น