สารบัญ7 หัวข้อหลัก
- 1.ตั้งปัญหาและทำความเข้าใจคุณภาพข้อมูล
- 2.แบ่งข้อมูล ป้องกัน leakage และควบคุมการเรียนรู้เกิน
- 3.เลือกตัวชี้วัดและตีความหลักฐานทางสถิติ
- 4.ลดมิติ จัดกลุ่ม ตรวจแบบจำลอง และทำซ้ำได้
- 5.สถาปัตยกรรมข้อมูลตั้งแต่ dictionary ถึง profiling
- 6.การวิเคราะห์ การทดลอง และแบบจำลองหลัก
- 7.การสื่อสาร กำกับ และเฝ้าระวังระบบผลิต
ตั้งปัญหาและทำความเข้าใจคุณภาพข้อมูล
วิทยาการข้อมูลเป็นศาสตร์สหวิทยาการที่เชื่อมคำถามและการตัดสินใจเข้ากับความรู้โดเมน การจัดการข้อมูล สถิติ การคำนวณ Machine Learning การทดลอง การสื่อสาร และการกำกับดูแล เป้าหมายมิใช่การได้แบบจำลองที่ซับซ้อนหรือมีคะแนนสูงสุดเพียงครั้งเดียว แต่คือผลที่เชื่อถือได้ ทำซ้ำได้ ใช้ตัดสินใจได้ และดูแลผลกระทบตลอดวงจรชีวิต งานหนึ่งจึงต้องมองเป็นระบบตั้งแต่แหล่งข้อมูลและกระบวนการเกิดค่า ไปจนถึงผู้ใช้ผลลัพธ์ เงื่อนไขการใช้งานจริง และวิธีตรวจว่าประโยชน์ที่คาดไว้เกิดขึ้นจริงหรือไม่
Decision; ใครใช้ผล ทําอะไร เมื่อใด และมีทางเลือกอะไร; Population/unit; ประชากรเป้าหมาย หน่วยหนึ่งแถว/หนึ่งคําทํานาย และ exclusions; Outcome/label; ความหมาย แหล่ง เวลา latency noise และใครถูกมองไม่เห็น; Prediction time; เวลาที่ต้องตัดสินและข้อมูลใดมีอยู่จริงก่อนเวลานั้น; Horizon; ทํานายล่วงหน้านานเท่าไรและ label window ปิดเมื่อใด; Cost/utility; FP/FN/delay/review/capacity/ผลกระทบต่อกลุ่มมีต้นทุนเท่าไร; Baseline; กฎง่าย, majority/mean, โมเดลเชิงเส้น หรือวิธีเดิมที่ต้องชนะ; Success/guardrail; metricหลักพร้อม calibration, subgroup, latency, privacy, fairness และ operation constraints; Stop/no-model option; เมื่อข้อมูลไม่พอ ความเสี่ยงเกิน หรือวิธีง่ายคุ้มกว่า ต้องกล้าหยุด/ไม่ใช้ ML; หัวข้อ; ต้องก
Schema/grain; ชนิดข้อมูล หน่วย หนึ่งแถวต่ออะไร key/timezone และ cardinality; Univariate; distribution, missing, range, impossible value, outlier, rare category; Bivariate; relationship กับ target/เวลา/กลุ่ม พร้อม nonlinearity และ confounding clue; Multivariate; correlation/redundancy, interaction, subgroup, Simpson’s paradox และ leakage proxy; Temporal; trend, seasonality, break, delay, future availability และ cohort change; Sampling; coverage, selection/nonresponse, duplicate entity และ population mismatch; Data-generating process; ใคร/อะไรสร้างค่า ภายใต้ policy/measurement/process ใด; Decision relevance; pattern ส่งผลต่อ action หรือเพียงน่าสนใจ; ระดับ; ตรวจอะไร; EDA ใช้หา defect, assumptio
Schema; column/type/nullability/order/version ตรง contract; Validity/range; อายุไม่ติดลบ codeอยู่ domain วันที่สัมพันธ์กัน; Completeness; missing rate รวม/ตามเวลา/กลุ่มไม่เกิน threshold; Uniqueness/grain; key ที่ควรหนึ่งแถวไม่ซ้ํา; event id deduplicate ได้; Referential integrity; foreign key เชื่อม master ได้ตามคาด; Consistency; ยอด สถานะ หน่วย timezone และนิยามสอดคล้องข้ามแหล่ง; Timeliness/freshness; ข้อมูลถึงตาม SLA และ cutoff ไม่ใช้อนาคต; Distribution; category ใหม่ range/quantile/frequency shift และ impossible combination; Label quality; definition, adjudication, delay, noise และ class prevalence; Reconciliation; row count/key count/sum/control total ก่อน–หลัง transform/join; Lineage/pro
Structural/not applicable; ไม่มีค่าเพราะตัวแปรไม่ใช้กับกรณีนั้น; แยกสถานะ ไม่เติมให้เหมือนค่าที่ควรมี; MCAR; การหายไม่ขึ้นกับข้อมูลสังเกต/ไม่สังเกตภายใต้แบบจําลอง; complete case อาจไม่ bias estimate บางชนิดแต่เสีย precision; MAR; การหายอธิบายได้ด้วยตัวแปรที่สังเกต; imputation/model ที่ใช้ตัวแปรช่วยพร้อม uncertainty; MNAR; การหายสัมพันธ์กับค่าที่หายหรือปัจจัยไม่สังเกตแม้ conditioning แล้ว; ต้องใช้ domain assumption, sensitivity/selection model; เติมธรรมดาไม่แก้; Operational missing; pipeline/sensor/form/error; แก้ต้นทางและ monitor—not มองเป็นสัญญาณถาวรทันที; Informative absence; การไม่มี event อาจมีความหมายแต่ขึ้นกับ coverage; feature missing indicator ได้เมื่อ valid และไม่สร้าง proxy harm; ก
ค่าผิดปกติสูง/ต่ํา; ลบทันทีด้วย z-score/IQR เดียว; ตรวจหน่วย source timestamp entity/context; แยก error/valid extreme/rare event แล้ว sensitivity; Duplicate exact; ใช้ DISTINCT ปิดอาการ; หา ingestion retry/key semantics และ deduplicateด้วยกฎ/เวลา/priority; Entity duplicate; ถือชื่อคล้ายเป็นคนเดียว; entity resolution พร้อม uncertainty และ manual reviewตาม risk; Key ควร unique แต่ซ้ํา; mergeต่อแล้วเฉลี่ยทีหลัง; หยุด ตรวจ grain/business rule แก้/aggregateโดยมีเหตุผลก่อน join; Row count เพิ่มหลายเท่า; คิดว่าเป็นข้อมูลเพิ่ม; ตรวจ join cardinality many-to-many, duplicate key และ expected multiplicity; Post-join totals เปลี่ยน; ใช้ยอดเดิมโดยไม่ reconcile; ตรวจ row/key/sum/null unmatched และ sample
- 1กำหนดการตัดสินใจ ผู้ใช้ หน่วยวิเคราะห์ ช่วงเวลา ต้นทุนความผิดพลาด และข้อจำกัดการใช้งาน
- 2สร้าง baseline ง่ายที่ตรวจสอบได้ เพื่อกำหนดระดับอ้างอิงก่อนเพิ่มข้อมูลหรือความซับซ้อนของโมเดล
- 3สำรวจการแจกแจง ความสัมพันธ์ missing, outlier, duplicate และผลของ join โดยแยกการค้นพบออกจากการยืนยัน
- 4ทำ data-quality contract สำหรับชนิดข้อมูล ช่วงค่า ความสด completeness uniqueness และเงื่อนไขสำคัญ
- 5ยุติหรือกักข้อมูลเมื่อผิดสัญญา แล้วบันทึกสาเหตุ การแก้ และผลต่อชุดฝึกกับข้อมูลที่ระบบผลิตใช้จริง
แบ่งข้อมูล ป้องกัน leakage และควบคุมการเรียนรู้เกิน
Split first; กัน test/validation/group/time ตาม design ก่อนเรียน preprocessing ใด ๆ; Numeric imputation; fit median/model/indicator เฉพาะ training fold แล้ว transform validation/test; Scaling; Standardization/robust/normalization เลือกตาม algorithm/distribution; fitใน fold; Categorical; one-hot/ordinal/target encoding ตามความหมาย; target encoding ต้อง out-of-fold/regularized; Unseen category; กําหนด unknown bucket/ignore/error/fallback และ monitor—not crashหรือ mapมั่ว; Feature selection/PCA; fitเฉพาะ training fold เพราะใช้ distribution/label; Pipeline; รวม transform+model เป็น estimator เดียวให้ CV/tuning fitทุกขั้นใน foldเดียวกัน; Production parity; ใช้ artifact/schema/order/versionเดียวกั
Train folds; fit model และ preprocessing; ห้ามมอง validation/test ระหว่าง fit; Validation/CV; เลือก feature, algorithm, hyperparameter, thresholdในบาง design; การลองซ้ํามากทําให้ overfit validation; Nested CV; outer ประเมิน, inner tune เมื่อข้อมูลน้อย/ต้องการ unbiased comparison; ควรหลีกเลี่ยงรายงาน inner best score เป็น final; Untouched test; ประเมินสุดท้ายครั้งจํากัดหลัง workflowล็อก; ดูแล้วแก้โมเดลซ้ําทําให้ testกลายเป็น validation; External/temporal test; วัด generalizationต่างสถานที่/เวลา; ควรหลีกเลี่ยงปนข้อมูลผู้ป่วย/คน/เหตุการณ์เดียวกัน; Post-deployment evaluation; วัด impact, drift, fairness และ calibrationจริง; offline test ไม่แทน production monitoring; ชุด/ชั้น; ใช้ทําอะไร; ข้อห้าม
i.i.d. ใกล้เคียง; random holdout/CV; ตรวจ duplicateและ preprocessing leakage; Class บวก 3%; stratified split ช่วยรักษาสัดส่วนโดยประมาณ; ไม่ได้แก้ imbalanceหรือรับประกันทุก subgroup; varianceยังสําคัญ; หลายระเบียนต่อบุคคล/สาขา; GroupShuffleSplit/GroupKFoldตาม entity; ระเบียนคนเดียวทั้ง train/test ทําให้จําตัวตน/บริบท; อนุกรมเวลา/พยากรณ์เดือนหน้า; chronological split, rolling/expanding backtest และ gapตาม latency; random splitใช้อนาคตสอนอดีตและประเมินเกินจริง; หลายโรงพยาบาล/พื้นที่; leave-site-out/external validationตาม deployment goal; random rows กลบ site-specific shortcut; Panel/household/network; splitตามหน่วย dependenceสูงสุด; independence assumptionและ CI/metricผิด; Intervention/A/B; ran
Post-outcome feature; “สถานะอนุมัติขั้นสุดท้าย” ใช้ทํานายการอนุมัติ; feature availability audit ณ prediction time; Target proxy; field/code/ข้อความที่สร้างจาก labelหรือหลัง reviewerเห็นผล; lineage + source/process review ไม่ดู correlationอย่างเดียว; Preprocessing leakage; เติมค่า/scale/PCA/feature selectionจากข้อมูลทั้งหมด; splitก่อนและ fitใน Pipelineแต่ละ fold; Group leakage; record คนเดียวอยู่ทั้ง train/test; group-aware split; Temporal leakage; aggregate eventหลัง cutoffหรือสุ่มเวลา; point-in-time joinและ temporal backtest; Validation leakage; tuneบน testหรือเลือกจาก CVเดิมแล้วรายงาน scoreเดิม; nested CV/untouched testและ logจํานวนการลอง; Duplicate leakage; duplicate/near-duplicate ข้ามชุ
Trainสูง Validationต่ํา; varianceสูง, leakageเฉพาะ train, modelซับซ้อน, distribution mismatch; learning curve, simplify/regularize, more representative data, split audit; TrainและValidationต่ําใกล้กัน; biasสูง, feature/labelไม่พอ, objectiveผิด, modelง่ายเกิน; baseline/error slices, better feature/data/model, redefine problem; Validationแกว่งมาก; sample/positiveน้อย, splitไม่เสถียร, group dependence; repeated/group CV, interval, collect data, simplify; Regularizationแรงขึ้น; ลงโทษค่าสัมประสิทธิ์/complexityมากขึ้น; โดยทั่วไป biasเพิ่ม varianceลด; train scoreอาจลดและ generalizationอาจดีถึงจุดหนึ่ง; L1; ส่งเสริม coefficientบางตัวเป็นศูนย์; ช่วย sparse selectionแต่ไม่เสถียรเมื่อ features correlat
Featuresสัมพันธ์กันสูง; โมเดลอาจทํานายรวมได้แต่ coefficientรายตัวแปรไม่เสถียร ค่า/เครื่องหมายเปลี่ยนตาม sample/ตัวแปรที่รวม; Standard error; มักสูงขึ้น ทําให้ intervalกว้างและ testราย coefficientไม่ชัด; Conditional meaning; coefficientคือ associationของ Xเมื่อคุมตัวแปรอื่นคงที่ ซึ่งอาจเป็นสถานการณ์ที่ข้อมูลแทบไม่มี; Scaling; coefficient magnitudeเทียบข้ามหน่วยไม่ได้โดยตรง; standardizeช่วยบางการเปรียบเทียบแต่ไม่สร้าง causal meaning; Remedy; ใช้ domainเพื่อรวม/เลือก feature, PCA/regularizationเพื่อ prediction, report stability/interval และหลีกเลี่ยง causal claim; VIF/correlation; เป็น diagnostic—not thresholdสากล; nonlinearity/dummy interactionอาจต้องดูเพิ่ม; ประเด็น; ผล; ควรหลีกเลี่ยงตัด feat
เนื้อหาสรุปนี้จัดทำขึ้นเพื่อการศึกษาส่วนบุคคล ห้ามคัดลอก ทำซ้ำ หรือนำไปใช้เพื่อวัตถุประสงค์ทางการค้าโดยไม่ได้รับอนุญาต