ในการเปรียบเทียบระหว่าง Batch Gradient Descent, Stochastic Gradient Descent (SGD) และ Mini-Batch Gradient Descent สำหรับการฝึก Neural Network ข้อใดอธิบายความแตกต่างและผลกระทบได้ถูกต้องที่สุด

Batch ใช้ข้อมูลทั้งหมดต่อการอัปเดตหนึ่งครั้ง ให้ Gradient เสถียรแต่ช้า, SGD ใช้ข้อมูลหนึ่งตัวอย่างต่อครั้ง เร็วแต่ Gradient ผันผวน, Mini-Batch สมดุลระหว่างทั้งสอง นิยมใช้ในทางปฏิบัติ
Batch Gradient Descent เหมาะสมที่สุดสำหรับ Dataset ขนาดใหญ่เพราะใช้ข้อมูลทั้งหมดพร้อมกัน
SGD ให้ผลดีที่สุดเสมอเพราะเป็นการอัปเดตแบบ Real-time จากข้อมูลล่าสุด
ทั้งสามวิธีให้ผลลัพธ์ที่เหมือนกัน แต่ต่างกันที่การใช้หน่วยความจำ (Memory) เท่านั้น

เฉลยอธิบาย

Batch GD คำนวณ Gradient จากข้อมูลทั้งหมดก่อนอัปเดต Weight ทำให้ Gradient แม่นยำแต่ช้าและต้องการ Memory มาก SGD อัปเดตทุกตัวอย่าง ทำให้เร็วแต่ Gradient มีเสียงรบกวนสูง อาจ Escape Local Minima ได้ดีกว่า Mini-Batch GD (ส่วนใหญ่ใช้ในทางปฏิบัติ) สมดุลระหว่างความเสถียรของ Gradient และความเร็ว ตัวเลือก B ผิดเพราะผลลัพธ์และเส้นทางการ Converge แตกต่างกัน ตัวเลือก C SGD ไม่ได้ดีที่สุดเสมอ มี Gradient Noise สูง ตัวเลือก D Batch GD ไม่เหมาะกับ Dataset ใหญ่เพราะ Memory ไม่เพียงพอ

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับปัญญาประดิษฐ์ (AI) และเทคโนโลยีดิจิทัล

ดูข้อสอบวิชานี้ทั้งหมด →