ในระบบ Multi-modal AI ที่รวม Vision, Language และ Audio เข้าด้วยกัน ความท้าทายหลักในการออกแบบสถาปัตยกรรมที่แตกต่างจากการสร้างโมเดลแต่ละประเภทแยกกันคืออะไร

การจัดการ Representation จากหลาย Modality ให้อยู่ใน Shared Latent Space เดียวกัน เพื่อให้โมเดลเข้าใจความสัมพันธ์ข้ามรูปแบบข้อมูลได้
การเพิ่มจำนวน Parameter ของโมเดลให้มากขึ้นกว่า 3 เท่า เพื่อรองรับข้อมูลหลายประเภทในเวลาเดียวกัน
การเลือก Framework การพัฒนาที่รองรับทั้ง PyTorch และ TensorFlow พร้อมกัน เพื่อให้โมเดลทำงานร่วมกันได้
การแยก Dataset ออกเป็น 3 ชุดสำหรับแต่ละ Modality และฝึก Loss Function แยกกันอย่างสมบูรณ์

เฉลยอธิบาย

ความท้าทายหลักของ Multi-modal AI คือการสร้าง Shared Latent Space หรือพื้นที่แทนค่าร่วม ที่สามารถเชื่อมโยงข้อมูลจากหลาย Modality เช่น ภาพ ข้อความ และเสียง ให้โมเดลเข้าใจความสัมพันธ์ระหว่างกันได้ เช่น การจับคู่ภาพกับคำบรรยาย ซึ่งไม่ใช่เพียงการเพิ่มขนาดโมเดลหรือแยก Framework แต่ต้องออกแบบกลไก Cross-modal Attention และ Fusion Strategy ที่เหมาะสม

ข้อสอบอื่นในวิชาความรู้เกี่ยวกับปัญญาประดิษฐ์ (AI) และเทคโนโลยีดิจิทัล

ดูข้อสอบวิชานี้ทั้งหมด →