ทีมนักวิจัยพัฒนาเฟรมเวิร์กการรับรู้ (Perception Pipeline) แบบโมดูลาร์สำหรับการทำงานของหุ่นยนต์ในห้องครัว เช่น การย้ายจานจากซิงค์ไปเครื่องล้างจาน หรือการวางถ้วยซ้อนกัน โดยระบบนี้ใช้โมเดลพื้นฐาน (Foundation Models) ระดับโลกหลายตัวร่วมกัน ได้แก่ LLMDet สำหรับตรวจจับวัตถุ, SAMv2 สำหรับการแยกส่วนภาพ, DINOv2 สำหรับการฟิวชั่นฟีเจอร์ และ GeoTransformer สำหรับการสร้างภาพ 3 มิติและวางแผนการหยิบจับ
จุดเด่นของระบบนี้คือความเป็นโมดูลาร์ที่สามารถสลับเปลี่ยนรุ่นของโมเดล AI ได้ตลอดเวลาเพื่อให้ได้ประสิทธิภาพสูงสุด ผลการทดสอบพบว่าระบบสามารถทำงานในสภาพครัวที่มีสิ่งของวางซ้อนกันและถูกบดบังได้เป็นอย่างดี โดยมีคะแนนความแม่นยำ (ADI) สูงถึง 89.12% และที่สำคัญคือสามารถนำไปใช้งานกับหุ่นยนต์ตัวจริงได้ทันทีโดยไม่ต้องผ่านการเทรนซ้ำในสภาพแวดล้อมใหม่