การประเมินโมเดล Generative AI ที่สร้างข้อความ (Text Generation) มีความท้าทายพิเศษอย่างไรเมื่อเทียบกับโมเดล Classification
กข้อความที่สร้างขึ้นมีคำตอบที่ถูกต้องได้หลายแบบ จึงต้องใช้ตัวชี้วัดเฉพาะ เช่น BLEU, ROUGE หรือการประเมินโดยมนุษย์ แทน Accuracy แบบทั่วไป
ขโมเดล Generative ต้องการข้อมูลน้อยกว่า จึงวัดผลได้ง่ายกว่า
คโมเดล Generative ไม่สามารถวัดประสิทธิภาพได้เลย
งไม่มีความแตกต่าง ใช้ Accuracy เหมือนกันทุกประการ
เฉลยอธิบาย
โมเดล Generative มีความท้าทายเฉพาะตัวเพราะคำตอบที่ดีอาจมีหลายรูปแบบ ไม่มีคำตอบ Ground Truth เดียว BLEU และ ROUGE วัดความคล้ายคลึงกับข้อความอ้างอิง แต่ก็ยังมีข้อจำกัด การประเมินโดยมนุษย์จึงยังเป็นมาตรฐานทองคำ ต่างจาก Classification ที่มีคำตอบถูกผิดชัดเจน ตัวเลือก A ผิดเพราะ Generative Model ต้องการข้อมูลมาก ตัวเลือก B ผิดเพราะ Accuracy ไม่เหมาะกับ Text Generation ตัวเลือก C ผิดเพราะมีตัวชี้วัดเฉพาะทางอยู่