ระบบ AI ที่ใช้ Attention Mechanism ใน Transformer ต่างจากโมเดล RNN แบบดั้งเดิมอย่างไรในการจัดการกับ Long-range Dependencies ในข้อความ

Transformer ใช้ข้อมูลจำนวนน้อยกว่า RNN จึงฝึกโมเดลได้เร็วกว่าและจัดการ Long-range Dependencies ได้ดีกว่า
Attention Mechanism ใช้หน่วยความจำ (Memory Cell) พิเศษเหมือน LSTM ทำให้ดีกว่า RNN ธรรมดา
Attention ให้โมเดลคำนวณความสัมพันธ์ระหว่างทุกคู่คำในประโยคพร้อมกัน (Parallelizable) โดยตรง แทนที่จะส่งผ่านข้อมูลตามลำดับผ่าน Hidden State เหมือน RNN จึงไม่เกิดปัญหา Vanishing Gradient กับ Dependencies ระยะไกล
Attention Mechanism ประมวลผลข้อความจากหน้าไปหลังทีละคำ ส่วน RNN ประมวลผลทั้งประโยคพร้อมกัน

เฉลยอธิบาย

Attention Mechanism ใน Transformer คำนวณ Attention Score ระหว่างทุกคู่ตำแหน่งในลำดับพร้อมกัน (Self-Attention) ทำให้โมเดลเข้าถึงความสัมพันธ์ระหว่างคำที่อยู่ห่างกันได้โดยตรงโดยไม่ต้องผ่าน Intermediate States เหมือน RNN ซึ่งแก้ปัญหา Vanishing Gradient และยังทำให้ Parallelize การฝึกได้ ตัวเลือก A สลับคำอธิบายผิด RNN ประมวลผลตามลำดับ Transformer ประมวลผลแบบ Parallel ตัวเลือก C Memory Cell เป็นคุณสมบัติของ LSTM ไม่ใช่ Transformer ตัวเลือก D Transformer ต้องการข้อมูลมหาศาล ไม่ได้ต้องการน้อยกว่า RNN

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับปัญญาประดิษฐ์ (AI) และเทคโนโลยีดิจิทัล

ดูข้อสอบวิชานี้ทั้งหมด →