ระบบ AI ที่ใช้ Attention Mechanism ใน Transformer ต่างจากโมเดล RNN แบบดั้งเดิมอย่างไรในการจัดการกับ Long-range Dependencies ในข้อความ
กTransformer ใช้ข้อมูลจำนวนน้อยกว่า RNN จึงฝึกโมเดลได้เร็วกว่าและจัดการ Long-range Dependencies ได้ดีกว่า
ขAttention Mechanism ใช้หน่วยความจำ (Memory Cell) พิเศษเหมือน LSTM ทำให้ดีกว่า RNN ธรรมดา
คAttention ให้โมเดลคำนวณความสัมพันธ์ระหว่างทุกคู่คำในประโยคพร้อมกัน (Parallelizable) โดยตรง แทนที่จะส่งผ่านข้อมูลตามลำดับผ่าน Hidden State เหมือน RNN จึงไม่เกิดปัญหา Vanishing Gradient กับ Dependencies ระยะไกล
งAttention Mechanism ประมวลผลข้อความจากหน้าไปหลังทีละคำ ส่วน RNN ประมวลผลทั้งประโยคพร้อมกัน
เฉลยอธิบาย
Attention Mechanism ใน Transformer คำนวณ Attention Score ระหว่างทุกคู่ตำแหน่งในลำดับพร้อมกัน (Self-Attention) ทำให้โมเดลเข้าถึงความสัมพันธ์ระหว่างคำที่อยู่ห่างกันได้โดยตรงโดยไม่ต้องผ่าน Intermediate States เหมือน RNN ซึ่งแก้ปัญหา Vanishing Gradient และยังทำให้ Parallelize การฝึกได้ ตัวเลือก A สลับคำอธิบายผิด RNN ประมวลผลตามลำดับ Transformer ประมวลผลแบบ Parallel ตัวเลือก C Memory Cell เป็นคุณสมบัติของ LSTM ไม่ใช่ Transformer ตัวเลือก D Transformer ต้องการข้อมูลมหาศาล ไม่ได้ต้องการน้อยกว่า RNN