ระบบ AI สำหรับตรวจจับสแปมอีเมล (Spam Detection) ฝึกบนข้อมูลอีเมลในภาษาอังกฤษเป็นหลัก เมื่อนำมาใช้กับองค์กรในประเทศไทยที่รับอีเมลทั้งภาษาไทยและอังกฤษ พบว่าระบบตรวจจับสแปมภาษาไทยได้ไม่ดี ปัญหานี้เรียกว่าอะไร
กOverfitting เพราะโมเดลจำข้อมูลฝึกได้มากเกินไป
ขUnderfitting เพราะโมเดลไม่ซับซ้อนพอที่จะเรียนรู้ภาษาใหม่
คData Imbalance เพราะสแปมมีน้อยกว่าอีเมลปกติในชุดข้อมูล
งDomain Shift หรือ Distribution Shift ซึ่งเกิดจากความแตกต่างระหว่างข้อมูลฝึกและข้อมูลจริงที่ใช้งาน
เฉลยอธิบาย
Domain Shift หรือ Distribution Shift คือปัญหาที่เกิดขึ้นเมื่อการกระจายตัวของข้อมูลที่โมเดลเจอในการใช้งานจริงแตกต่างจากข้อมูลที่ใช้ฝึก ในกรณีนี้โมเดลฝึกกับภาษาอังกฤษแต่เจอภาษาไทยในการใช้งานจริง ตัวเลือก B Overfitting เกิดจากการจำข้อมูลฝึกมากเกินไปแต่ยังคงอยู่ในโดเมนเดิม ตัวเลือก C Underfitting คือโมเดลไม่เรียนรู้ได้ดีแม้แต่ในข้อมูลฝึก ตัวเลือก D Data Imbalance เกี่ยวกับสัดส่วนของคลาส ไม่ใช่ปัญหาภาษา