การวิเคราะห์ความรู้สึก (Sentiment Analysis) ด้วย AI ในข้อความภาษาไทยที่มีการใช้ภาษาแบบ Code-Switching (ผสมภาษาไทย-อังกฤษ) และภาษาสแลงออนไลน์ มีความท้าทายเฉพาะอะไรที่แตกต่างจากภาษาอังกฤษมาตรฐาน
กขาดแคลน Pre-trained Models สำหรับภาษาไทย รวมถึงความซับซ้อนของการตัดคำ (Word Segmentation) เพราะภาษาไทยไม่มีช่องว่างระหว่างคำ และความหมายเปลี่ยนตาม Context และวรรณยุกต์
ขภาษาไทยมีกฎไวยากรณ์ที่เข้มงวดเกินไปทำให้ AI ไม่สามารถเข้าใจโครงสร้างประโยคได้
คภาษาไทยใช้ตัวอักษรที่มีจำนวนมากกว่าทำให้คอมพิวเตอร์ประมวลผลช้ากว่า
งความท้าทายเหมือนกันกับภาษาอังกฤษทุกประการ แต่ต้องแปลข้อมูลก่อนวิเคราะห์
เฉลยอธิบาย
ภาษาไทยมีความท้าทายเฉพาะหลายประการ ได้แก่ (1) Word Segmentation ภาษาไทยไม่มีช่องว่างระหว่างคำ ทำให้การตัดคำมีความซับซ้อนสูง เช่น 'ตากลม' อาจหมายถึงตาที่กลม หรือพ่อที่ชื่อกลม (2) วรรณยุกต์เปลี่ยนความหมายอย่างสิ้นเชิง (3) ภาษาสแลงและ Code-Switching เปลี่ยนแปลงรวดเร็วกว่าโมเดลที่ฝึกไว้ (4) ขาด Labeled Dataset คุณภาพสูงสำหรับภาษาไทย ตัวเลือก A เป็นข้อเท็จจริงบางส่วนแต่ไม่ใช่ความท้าทายหลัก ตัวเลือก C ผิดเพราะภาษาไทยค่อนข้างยืดหยุ่นด้านไวยากรณ์ และตัวเลือก D ผิดอย่างชัดเจนเพราะการแปลก่อนจะสูญเสีย Nuance และ Cultural Context