ในการฝึกโมเดล Deep Learning ขนาดใหญ่ นักวิจัยพบว่า Loss ไม่ลดลงแม้ฝึกนานมาก ปัญหานี้มักเรียกว่า 'Vanishing Gradient' กลไกใดที่ถูกพัฒนาขึ้นมาเพื่อแก้ปัญหานี้โดยตรง
กBatch Normalization และ Residual Connections (Skip Connections) เพื่อให้ Gradient ไหลผ่านเครือข่ายได้ดีขึ้น
ขDropout เป็นการสุ่มปิดบาง Neuron เพื่อลด Overfitting
คData Augmentation เป็นการเพิ่มข้อมูลฝึกเทียม
งEarly Stopping เป็นการหยุดฝึกก่อนที่จะ Overfit
เฉลยอธิบาย
Vanishing Gradient เกิดขึ้นเมื่อ Gradient หดตัวลงเรื่อยๆ เมื่อส่งย้อนกลับผ่านหลาย Layer ทำให้ Layer ต้นๆ เรียนรู้ได้ช้ามาก แนวทางแก้ไขโดยตรงคือ Batch Normalization ที่ทำให้ค่า Activation อยู่ในช่วงที่เหมาะสม และ Residual Connections ในสถาปัตยกรรม ResNet ที่สร้าง Shortcut ให้ Gradient ไหลผ่านได้โดยตรง ตัวเลือก A ผิดเพราะ Dropout แก้ Overfitting ไม่ใช่ Vanishing Gradient ตัวเลือก C ผิดเพราะ Data Augmentation เพิ่มความหลากหลายของข้อมูล ตัวเลือก D ผิดเพราะ Early Stopping หยุดก่อน Overfit ไม่แก้ปัญหา Gradient