รายงานต้องหลีกเลี่ยงแกนกราฟและสัดส่วนที่ทำให้ขนาดผลดูเกินจริง จึงถามว่า ในการประมวลผลข้อมูล Big Data ที่มีหลายแหล่งและปรับปรุงอย่างต่อเนื่อง ควรสร้างระบบ Data Pipeline อย่างไร
กเลือก Pipeline ที่มีต้นทุนต่ำสุด โดยถือว่าเป็นแนวทางหลักที่หน่วยงานควรใช้ในทุกกรณี
ขสร้าง Pipeline แบบอัตโนมัติที่ตรวจสอบและประมวลผลข้อมูลใหม่ทันที มี Version Control และ Logging
คประมวลผลข้อมูลด้วยมือเสมอเพื่อให้แม่นยำ โดยไม่ต้องพิจารณานโยบาย บทบาท หรือความเสี่ยงด้านข้อมูลเพิ่มเติม
งสร้าง Pipeline แบบคงที่ที่ประมวลผลข้อมูลเพียงครั้งเดียวในแต่ละเดือน
เฉลยอธิบาย
ระบบ Data Pipeline ที่ดีควรเป็น Automated, Scalable, Traceable และ Maintainable ควรตรวจสอบข้อมูลใหม่อย่างต่อเนื่อง มี Version Control เพื่อตรวจสอบความเปลี่ยนแปลง และ Logging เพื่อการแก้ไขปัญหา ตัวเลือก A ไม่ตอบสนองต่อข้อมูลใหม่ ตัวเลือก C ไม่เหมาะสำหรับข้อมูลขนาดใหญ่ ตัวเลือก D อาจส่งผลให้เสียคุณภาพ