เพราะเหตุใดจึงกล่าวว่า Transformer Architecture ที่ใช้ใน Modern Language Models มีข้อดีกว่า Recurrent Neural Networks ในการประมวลผลลำดับข้อความยาว
กTransformer สามารถประมวลผลข้อมูลได้เร็วกว่า RNN เนื่องจากใช้ GPU ดีกว่า
ขTransformer มีจำนวน Parameters มากกว่า RNN
คTransformer ต้องใช้ข้อมูลฝึกน้อยกว่า RNN
งTransformer ใช้กลไก Attention ที่สามารถเชื่อมโยงคำที่ห่างไกลกันได้โดยตรง ขณะที่ RNN ต้องประมวลผลแบบตามลำดับซึ่งทำให้สูญเสียข้อมูลจากคำหลังแบบค่อยๆ
เฉลยอธิบาย
นี่คือความก้าวหน้าสำคัญทางวิชาการของ Deep Learning ที่ปัจจุบัน Transformer มี Self-Attention mechanism ที่ให้ความสำคัญต่อความสัมพันธ์ระหว่างคำในข้อความ โดยไม่คำนึงว่าห่างกันเท่าไร ขณะที่ RNN ประมวลผลเชิงเส้นทีละเซล ซึ่งทำให้สูญเสีย Information ที่ระยะไกล (Vanishing Gradient Problem) ตัวเลือก B เป็นเรื่องของขนาดไม่ใช่เหตุผล ตัวเลือก C เป็นเรื่องของ Implementation ไม่ใช่โครงสร้างอัลกอริทึม ตัวเลือก D ไม่ถูกต้อง Transformer มักต้องการข้อมูลเยอะกว่า