ในระบบ Multi-modal AI ที่รวม Vision, Language และ Audio เข้าด้วยกัน ความท้าทายหลักในการออกแบบสถาปัตยกรรมที่แตกต่างจากการสร้างโมเดลแต่ละประเภทแยกกันคืออะไร
กการจัดการ Representation จากหลาย Modality ให้อยู่ใน Shared Latent Space เดียวกัน เพื่อให้โมเดลเข้าใจความสัมพันธ์ข้ามรูปแบบข้อมูลได้
ขการเพิ่มจำนวน Parameter ของโมเดลให้มากขึ้นกว่า 3 เท่า เพื่อรองรับข้อมูลหลายประเภทในเวลาเดียวกัน
คการเลือก Framework การพัฒนาที่รองรับทั้ง PyTorch และ TensorFlow พร้อมกัน เพื่อให้โมเดลทำงานร่วมกันได้
งการแยก Dataset ออกเป็น 3 ชุดสำหรับแต่ละ Modality และฝึก Loss Function แยกกันอย่างสมบูรณ์
เฉลยอธิบาย
ความท้าทายหลักของ Multi-modal AI คือการสร้าง Shared Latent Space หรือพื้นที่แทนค่าร่วม ที่สามารถเชื่อมโยงข้อมูลจากหลาย Modality เช่น ภาพ ข้อความ และเสียง ให้โมเดลเข้าใจความสัมพันธ์ระหว่างกันได้ เช่น การจับคู่ภาพกับคำบรรยาย ซึ่งไม่ใช่เพียงการเพิ่มขนาดโมเดลหรือแยก Framework แต่ต้องออกแบบกลไก Cross-modal Attention และ Fusion Strategy ที่เหมาะสม