ผู้วิเคราะห์ทดสอบหลายสมมติฐานพร้อมกันและต้องควบคุมความเสี่ยงผลบวกลวง จึงพิจารณาว่า เมื่อทำความสะอาดข้อมูลจำนวนประชากรของเมืองต่างๆ พบว่ามีการบันทึกตัวอักษรปะปนกับตัวเลข เช่น '1,500P' แทนที่จะเป็น '1500' ควรจัดการกับปัญหานี้อย่างไรจึงจะเหมาะสมที่สุด

เปลี่ยนชนิดข้อมูลของคอลัมน์ทั้งหมดเป็น String แล้วนำไปวิเคราะห์โดยตรง เพื่อหลีกเลี่ยงข้อผิดพลาดจากการแปลงข้อมูล
ลบแถวข้อมูลที่มีตัวอักษรปะปนออกทั้งหมด เพราะข้อมูลดังกล่าวถือว่าเสียหายและไม่สามารถนำไปใช้งานได้
แทนที่ค่าที่มีตัวอักษรปะปนด้วยค่าเฉลี่ย (Mean) ของคอลัมน์นั้น เพื่อรักษาจำนวนแถวข้อมูลให้ครบถ้วน
ใช้ฟังก์ชัน Regular Expression เพื่อกรองเอาเฉพาะตัวเลขออกมา แล้วแปลงข้อมูลให้เป็นชนิดตัวเลข (Numeric) ก่อนนำไปวิเคราะห์

เฉลยอธิบาย

การใช้ Regular Expression เพื่อกรองเอาเฉพาะตัวเลขออกจากสตริงเช่น '1,500P' แล้วแปลงเป็นชนิดตัวเลข เป็นวิธีที่ถูกต้องและเหมาะสมที่สุดในการทำความสะอาดข้อมูล เพราะสามารถกู้คืนข้อมูลที่มีประโยชน์ได้โดยไม่ต้องสูญเสียแถวข้อมูล การลบแถวออกทั้งหมด (B) ทำให้สูญเสียข้อมูลโดยไม่จำเป็น การแทนด้วยค่าเฉลี่ย (C) ไม่เหมาะสมเพราะข้อมูลยังสามารถกู้คืนได้ และการเปลี่ยนเป็น String (D) ทำให้ไม่สามารถวิเคราะห์เชิงปริมาณได้

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับการประมวลผลข้อมูลและวิเคราะห์ข้อมูล

ดูข้อสอบวิชานี้ทั้งหมด →