ระบบ AI สำหรับตรวจจับสแปมอีเมล (Spam Detection) ฝึกบนข้อมูลอีเมลในภาษาอังกฤษเป็นหลัก เมื่อนำมาใช้กับองค์กรในประเทศไทยที่รับอีเมลทั้งภาษาไทยและอังกฤษ พบว่าระบบตรวจจับสแปมภาษาไทยได้ไม่ดี ปัญหานี้เรียกว่าอะไร

Overfitting เพราะโมเดลจำข้อมูลฝึกได้มากเกินไป
Underfitting เพราะโมเดลไม่ซับซ้อนพอที่จะเรียนรู้ภาษาใหม่
Data Imbalance เพราะสแปมมีน้อยกว่าอีเมลปกติในชุดข้อมูล
Domain Shift หรือ Distribution Shift ซึ่งเกิดจากความแตกต่างระหว่างข้อมูลฝึกและข้อมูลจริงที่ใช้งาน

เฉลยอธิบาย

Domain Shift หรือ Distribution Shift คือปัญหาที่เกิดขึ้นเมื่อการกระจายตัวของข้อมูลที่โมเดลเจอในการใช้งานจริงแตกต่างจากข้อมูลที่ใช้ฝึก ในกรณีนี้โมเดลฝึกกับภาษาอังกฤษแต่เจอภาษาไทยในการใช้งานจริง ตัวเลือก B Overfitting เกิดจากการจำข้อมูลฝึกมากเกินไปแต่ยังคงอยู่ในโดเมนเดิม ตัวเลือก C Underfitting คือโมเดลไม่เรียนรู้ได้ดีแม้แต่ในข้อมูลฝึก ตัวเลือก D Data Imbalance เกี่ยวกับสัดส่วนของคลาส ไม่ใช่ปัญหาภาษา

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับปัญญาประดิษฐ์ (AI) และเทคโนโลยีดิจิทัล

ดูข้อสอบวิชานี้ทั้งหมด →