การขยายขนาดข้อมูลหุ่นยนต์ (Data scaling) เป็นเรื่องยากและมีราคาแพง งานวิจัยนี้จึงนำเสนอ VLAct ซึ่งเป็นโครงสร้างหลัก (Backbone) สำหรับโมเดล Vision-Language-Action ที่ใช้เทคนิค 'Representation-Centric Continued Pre-training' โดยเน้นการดึงความรู้จากข้อมูลวิถีการเคลื่อนที่ (Trajectories) ของหุ่นยนต์หลากหลายรูปแบบ (Multi-embodiment) มาเป็นความรู้ที่ถ่ายโอนได้
VLAct ใช้การฝึกด้วยข้อมูลแบบโอเพนซอร์สบนระบบที่มี GPU เพียง 16 ตัว แต่สามารถให้ผลลัพธ์ที่เหนือกว่าระบบอุตสาหกรรมอย่าง ABot-M0 และ LingBot-VLA ในการทดสอบ LIBERO-Plus และ RoboTwin 2.0 โดยทำคะแนนความสำเร็จได้ถึง 82.6% และ 92.5% ตามลำดับ นอกจากนี้ยังแสดงความสามารถในการทำงานร่วมกับหุ่นยนต์ฮิวแมนนอยด์ (Humanoid) ที่ไม่เคยเห็นมาก่อนได้อย่างมีประสิทธิภาพ แม้จะใช้ข้อมูลสำหรับการปรับจูนเพียง 20% เท่านั้น