เพราะเหตุใดจึงกล่าวว่า Transformer Architecture ที่ใช้ใน Modern Language Models มีข้อดีกว่า Recurrent Neural Networks ในการประมวลผลลำดับข้อความยาว

Transformer สามารถประมวลผลข้อมูลได้เร็วกว่า RNN เนื่องจากใช้ GPU ดีกว่า
Transformer มีจำนวน Parameters มากกว่า RNN
Transformer ต้องใช้ข้อมูลฝึกน้อยกว่า RNN
Transformer ใช้กลไก Attention ที่สามารถเชื่อมโยงคำที่ห่างไกลกันได้โดยตรง ขณะที่ RNN ต้องประมวลผลแบบตามลำดับซึ่งทำให้สูญเสียข้อมูลจากคำหลังแบบค่อยๆ

เฉลยอธิบาย

นี่คือความก้าวหน้าสำคัญทางวิชาการของ Deep Learning ที่ปัจจุบัน Transformer มี Self-Attention mechanism ที่ให้ความสำคัญต่อความสัมพันธ์ระหว่างคำในข้อความ โดยไม่คำนึงว่าห่างกันเท่าไร ขณะที่ RNN ประมวลผลเชิงเส้นทีละเซล ซึ่งทำให้สูญเสีย Information ที่ระยะไกล (Vanishing Gradient Problem) ตัวเลือก B เป็นเรื่องของขนาดไม่ใช่เหตุผล ตัวเลือก C เป็นเรื่องของ Implementation ไม่ใช่โครงสร้างอัลกอริทึม ตัวเลือก D ไม่ถูกต้อง Transformer มักต้องการข้อมูลเยอะกว่า

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับปัญญาประดิษฐ์ (AI) และเทคโนโลยีดิจิทัล

ดูข้อสอบวิชานี้ทั้งหมด →