กลับไปทำข้อสอบวิชานี้

วิทยาการข้อมูล (Data Science)

คู่มือเชื่อมปัญหา ข้อมูล แบบจำลอง การประเมิน และระบบผลิตให้เป็นวงจรที่ตรวจสอบและดูแลต่อได้

7 หัวข้อ · อ่านประมาณ 48 นาที

อ่านฟรีได้ 2 จาก 7 หัวข้อ29%
หัวข้อ 1

ตั้งปัญหาและทำความเข้าใจคุณภาพข้อมูล

วิทยาการข้อมูลเป็นศาสตร์สหวิทยาการที่เชื่อมคำถามและการตัดสินใจเข้ากับความรู้โดเมน การจัดการข้อมูล สถิติ การคำนวณ Machine Learning การทดลอง การสื่อสาร และการกำกับดูแล เป้าหมายมิใช่การได้แบบจำลองที่ซับซ้อนหรือมีคะแนนสูงสุดเพียงครั้งเดียว แต่คือผลที่เชื่อถือได้ ทำซ้ำได้ ใช้ตัดสินใจได้ และดูแลผลกระทบตลอดวงจรชีวิต งานหนึ่งจึงต้องมองเป็นระบบตั้งแต่แหล่งข้อมูลและกระบวนการเกิดค่า ไปจนถึงผู้ใช้ผลลัพธ์ เงื่อนไขการใช้งานจริง และวิธีตรวจว่าประโยชน์ที่คาดไว้เกิดขึ้นจริงหรือไม่

Decision; ใครใช้ผล ทําอะไร เมื่อใด และมีทางเลือกอะไร; Population/unit; ประชากรเป้าหมาย หน่วยหนึ่งแถว/หนึ่งคําทํานาย และ exclusions; Outcome/label; ความหมาย แหล่ง เวลา latency noise และใครถูกมองไม่เห็น; Prediction time; เวลาที่ต้องตัดสินและข้อมูลใดมีอยู่จริงก่อนเวลานั้น; Horizon; ทํานายล่วงหน้านานเท่าไรและ label window ปิดเมื่อใด; Cost/utility; FP/FN/delay/review/capacity/ผลกระทบต่อกลุ่มมีต้นทุนเท่าไร; Baseline; กฎง่าย, majority/mean, โมเดลเชิงเส้น หรือวิธีเดิมที่ต้องชนะ; Success/guardrail; metricหลักพร้อม calibration, subgroup, latency, privacy, fairness และ operation constraints; Stop/no-model option; เมื่อข้อมูลไม่พอ ความเสี่ยงเกิน หรือวิธีง่ายคุ้มกว่า ต้องกล้าหยุด/ไม่ใช้ ML; หัวข้อ; ต้องก

Schema/grain; ชนิดข้อมูล หน่วย หนึ่งแถวต่ออะไร key/timezone และ cardinality; Univariate; distribution, missing, range, impossible value, outlier, rare category; Bivariate; relationship กับ target/เวลา/กลุ่ม พร้อม nonlinearity และ confounding clue; Multivariate; correlation/redundancy, interaction, subgroup, Simpson’s paradox และ leakage proxy; Temporal; trend, seasonality, break, delay, future availability และ cohort change; Sampling; coverage, selection/nonresponse, duplicate entity และ population mismatch; Data-generating process; ใคร/อะไรสร้างค่า ภายใต้ policy/measurement/process ใด; Decision relevance; pattern ส่งผลต่อ action หรือเพียงน่าสนใจ; ระดับ; ตรวจอะไร; EDA ใช้หา defect, assumptio

Schema; column/type/nullability/order/version ตรง contract; Validity/range; อายุไม่ติดลบ codeอยู่ domain วันที่สัมพันธ์กัน; Completeness; missing rate รวม/ตามเวลา/กลุ่มไม่เกิน threshold; Uniqueness/grain; key ที่ควรหนึ่งแถวไม่ซ้ํา; event id deduplicate ได้; Referential integrity; foreign key เชื่อม master ได้ตามคาด; Consistency; ยอด สถานะ หน่วย timezone และนิยามสอดคล้องข้ามแหล่ง; Timeliness/freshness; ข้อมูลถึงตาม SLA และ cutoff ไม่ใช้อนาคต; Distribution; category ใหม่ range/quantile/frequency shift และ impossible combination; Label quality; definition, adjudication, delay, noise และ class prevalence; Reconciliation; row count/key count/sum/control total ก่อน–หลัง transform/join; Lineage/pro

Structural/not applicable; ไม่มีค่าเพราะตัวแปรไม่ใช้กับกรณีนั้น; แยกสถานะ ไม่เติมให้เหมือนค่าที่ควรมี; MCAR; การหายไม่ขึ้นกับข้อมูลสังเกต/ไม่สังเกตภายใต้แบบจําลอง; complete case อาจไม่ bias estimate บางชนิดแต่เสีย precision; MAR; การหายอธิบายได้ด้วยตัวแปรที่สังเกต; imputation/model ที่ใช้ตัวแปรช่วยพร้อม uncertainty; MNAR; การหายสัมพันธ์กับค่าที่หายหรือปัจจัยไม่สังเกตแม้ conditioning แล้ว; ต้องใช้ domain assumption, sensitivity/selection model; เติมธรรมดาไม่แก้; Operational missing; pipeline/sensor/form/error; แก้ต้นทางและ monitor—not มองเป็นสัญญาณถาวรทันที; Informative absence; การไม่มี event อาจมีความหมายแต่ขึ้นกับ coverage; feature missing indicator ได้เมื่อ valid และไม่สร้าง proxy harm; ก

ค่าผิดปกติสูง/ต่ํา; ลบทันทีด้วย z-score/IQR เดียว; ตรวจหน่วย source timestamp entity/context; แยก error/valid extreme/rare event แล้ว sensitivity; Duplicate exact; ใช้ DISTINCT ปิดอาการ; หา ingestion retry/key semantics และ deduplicateด้วยกฎ/เวลา/priority; Entity duplicate; ถือชื่อคล้ายเป็นคนเดียว; entity resolution พร้อม uncertainty และ manual reviewตาม risk; Key ควร unique แต่ซ้ํา; mergeต่อแล้วเฉลี่ยทีหลัง; หยุด ตรวจ grain/business rule แก้/aggregateโดยมีเหตุผลก่อน join; Row count เพิ่มหลายเท่า; คิดว่าเป็นข้อมูลเพิ่ม; ตรวจ join cardinality many-to-many, duplicate key และ expected multiplicity; Post-join totals เปลี่ยน; ใช้ยอดเดิมโดยไม่ reconcile; ตรวจ row/key/sum/null unmatched และ sample

  1. 1กำหนดการตัดสินใจ ผู้ใช้ หน่วยวิเคราะห์ ช่วงเวลา ต้นทุนความผิดพลาด และข้อจำกัดการใช้งาน
  2. 2สร้าง baseline ง่ายที่ตรวจสอบได้ เพื่อกำหนดระดับอ้างอิงก่อนเพิ่มข้อมูลหรือความซับซ้อนของโมเดล
  3. 3สำรวจการแจกแจง ความสัมพันธ์ missing, outlier, duplicate และผลของ join โดยแยกการค้นพบออกจากการยืนยัน
  4. 4ทำ data-quality contract สำหรับชนิดข้อมูล ช่วงค่า ความสด completeness uniqueness และเงื่อนไขสำคัญ
  5. 5ยุติหรือกักข้อมูลเมื่อผิดสัญญา แล้วบันทึกสาเหตุ การแก้ และผลต่อชุดฝึกกับข้อมูลที่ระบบผลิตใช้จริง
หัวข้อ 2

แบ่งข้อมูล ป้องกัน leakage และควบคุมการเรียนรู้เกิน

Split first; กัน test/validation/group/time ตาม design ก่อนเรียน preprocessing ใด ๆ; Numeric imputation; fit median/model/indicator เฉพาะ training fold แล้ว transform validation/test; Scaling; Standardization/robust/normalization เลือกตาม algorithm/distribution; fitใน fold; Categorical; one-hot/ordinal/target encoding ตามความหมาย; target encoding ต้อง out-of-fold/regularized; Unseen category; กําหนด unknown bucket/ignore/error/fallback และ monitor—not crashหรือ mapมั่ว; Feature selection/PCA; fitเฉพาะ training fold เพราะใช้ distribution/label; Pipeline; รวม transform+model เป็น estimator เดียวให้ CV/tuning fitทุกขั้นใน foldเดียวกัน; Production parity; ใช้ artifact/schema/order/versionเดียวกั

Train folds; fit model และ preprocessing; ห้ามมอง validation/test ระหว่าง fit; Validation/CV; เลือก feature, algorithm, hyperparameter, thresholdในบาง design; การลองซ้ํามากทําให้ overfit validation; Nested CV; outer ประเมิน, inner tune เมื่อข้อมูลน้อย/ต้องการ unbiased comparison; ควรหลีกเลี่ยงรายงาน inner best score เป็น final; Untouched test; ประเมินสุดท้ายครั้งจํากัดหลัง workflowล็อก; ดูแล้วแก้โมเดลซ้ําทําให้ testกลายเป็น validation; External/temporal test; วัด generalizationต่างสถานที่/เวลา; ควรหลีกเลี่ยงปนข้อมูลผู้ป่วย/คน/เหตุการณ์เดียวกัน; Post-deployment evaluation; วัด impact, drift, fairness และ calibrationจริง; offline test ไม่แทน production monitoring; ชุด/ชั้น; ใช้ทําอะไร; ข้อห้าม

i.i.d. ใกล้เคียง; random holdout/CV; ตรวจ duplicateและ preprocessing leakage; Class บวก 3%; stratified split ช่วยรักษาสัดส่วนโดยประมาณ; ไม่ได้แก้ imbalanceหรือรับประกันทุก subgroup; varianceยังสําคัญ; หลายระเบียนต่อบุคคล/สาขา; GroupShuffleSplit/GroupKFoldตาม entity; ระเบียนคนเดียวทั้ง train/test ทําให้จําตัวตน/บริบท; อนุกรมเวลา/พยากรณ์เดือนหน้า; chronological split, rolling/expanding backtest และ gapตาม latency; random splitใช้อนาคตสอนอดีตและประเมินเกินจริง; หลายโรงพยาบาล/พื้นที่; leave-site-out/external validationตาม deployment goal; random rows กลบ site-specific shortcut; Panel/household/network; splitตามหน่วย dependenceสูงสุด; independence assumptionและ CI/metricผิด; Intervention/A/B; ran

Post-outcome feature; “สถานะอนุมัติขั้นสุดท้าย” ใช้ทํานายการอนุมัติ; feature availability audit ณ prediction time; Target proxy; field/code/ข้อความที่สร้างจาก labelหรือหลัง reviewerเห็นผล; lineage + source/process review ไม่ดู correlationอย่างเดียว; Preprocessing leakage; เติมค่า/scale/PCA/feature selectionจากข้อมูลทั้งหมด; splitก่อนและ fitใน Pipelineแต่ละ fold; Group leakage; record คนเดียวอยู่ทั้ง train/test; group-aware split; Temporal leakage; aggregate eventหลัง cutoffหรือสุ่มเวลา; point-in-time joinและ temporal backtest; Validation leakage; tuneบน testหรือเลือกจาก CVเดิมแล้วรายงาน scoreเดิม; nested CV/untouched testและ logจํานวนการลอง; Duplicate leakage; duplicate/near-duplicate ข้ามชุ

Trainสูง Validationต่ํา; varianceสูง, leakageเฉพาะ train, modelซับซ้อน, distribution mismatch; learning curve, simplify/regularize, more representative data, split audit; TrainและValidationต่ําใกล้กัน; biasสูง, feature/labelไม่พอ, objectiveผิด, modelง่ายเกิน; baseline/error slices, better feature/data/model, redefine problem; Validationแกว่งมาก; sample/positiveน้อย, splitไม่เสถียร, group dependence; repeated/group CV, interval, collect data, simplify; Regularizationแรงขึ้น; ลงโทษค่าสัมประสิทธิ์/complexityมากขึ้น; โดยทั่วไป biasเพิ่ม varianceลด; train scoreอาจลดและ generalizationอาจดีถึงจุดหนึ่ง; L1; ส่งเสริม coefficientบางตัวเป็นศูนย์; ช่วย sparse selectionแต่ไม่เสถียรเมื่อ features correlat

Featuresสัมพันธ์กันสูง; โมเดลอาจทํานายรวมได้แต่ coefficientรายตัวแปรไม่เสถียร ค่า/เครื่องหมายเปลี่ยนตาม sample/ตัวแปรที่รวม; Standard error; มักสูงขึ้น ทําให้ intervalกว้างและ testราย coefficientไม่ชัด; Conditional meaning; coefficientคือ associationของ Xเมื่อคุมตัวแปรอื่นคงที่ ซึ่งอาจเป็นสถานการณ์ที่ข้อมูลแทบไม่มี; Scaling; coefficient magnitudeเทียบข้ามหน่วยไม่ได้โดยตรง; standardizeช่วยบางการเปรียบเทียบแต่ไม่สร้าง causal meaning; Remedy; ใช้ domainเพื่อรวม/เลือก feature, PCA/regularizationเพื่อ prediction, report stability/interval และหลีกเลี่ยง causal claim; VIF/correlation; เป็น diagnostic—not thresholdสากล; nonlinearity/dummy interactionอาจต้องดูเพิ่ม; ประเด็น; ผล; ควรหลีกเลี่ยงตัด feat

อ่านสรุปฉบับเต็มทุกหัวข้อ
สมาชิก PRO ระบบจะจำหัวข้อที่อ่านค้างไว้ให้ด้วย
PRO 99 บาท/เดือน

เนื้อหาสรุปนี้จัดทำขึ้นเพื่อการศึกษาส่วนบุคคล ห้ามคัดลอก ทำซ้ำ หรือนำไปใช้เพื่อวัตถุประสงค์ทางการค้าโดยไม่ได้รับอนุญาต