AI & MACHINE LEARNING

VLAct: โมเดล VLA ประสิทธิภาพสูงที่ใช้ทรัพยากรการฝึกน้อยลงด้วยเทคนิค Continued Pre-training

arXiv31 Aug 2026
1 min read
Key Takeaways
  • VLAct สามารถสร้างโมเดลหุ่นยนต์ที่ทรงพลังและยืดหยุ่นได้ภายใต้งบประมาณที่จำกัด โดยเน้นการรักษาความรู้เดิมจาก VLM และเพิ่มความเข้าใจในแอ็กชันข้ามรูปแบบหุ่นยนต์

ทำไมเรื่องนี้ถึงสำคัญ

พิสูจน์ให้เห็นว่าการพัฒนาหุ่นยนต์อเนกประสงค์ไม่จำเป็นต้องใช้ทรัพยากรคำนวณมหาศาลเสมอไป หากมีวิธีการจัดการข้อมูลและโครงสร้างโมเดลที่มีประสิทธิภาพ

การขยายขนาดข้อมูลหุ่นยนต์ (Data scaling) เป็นเรื่องยากและมีราคาแพง งานวิจัยนี้จึงนำเสนอ VLAct ซึ่งเป็นโครงสร้างหลัก (Backbone) สำหรับโมเดล Vision-Language-Action ที่ใช้เทคนิค 'Representation-Centric Continued Pre-training' โดยเน้นการดึงความรู้จากข้อมูลวิถีการเคลื่อนที่ (Trajectories) ของหุ่นยนต์หลากหลายรูปแบบ (Multi-embodiment) มาเป็นความรู้ที่ถ่ายโอนได้

VLAct ใช้การฝึกด้วยข้อมูลแบบโอเพนซอร์สบนระบบที่มี GPU เพียง 16 ตัว แต่สามารถให้ผลลัพธ์ที่เหนือกว่าระบบอุตสาหกรรมอย่าง ABot-M0 และ LingBot-VLA ในการทดสอบ LIBERO-Plus และ RoboTwin 2.0 โดยทำคะแนนความสำเร็จได้ถึง 82.6% และ 92.5% ตามลำดับ นอกจากนี้ยังแสดงความสามารถในการทำงานร่วมกับหุ่นยนต์ฮิวแมนนอยด์ (Humanoid) ที่ไม่เคยเห็นมาก่อนได้อย่างมีประสิทธิภาพ แม้จะใช้ข้อมูลสำหรับการปรับจูนเพียง 20% เท่านั้น

สรุปประเด็นหลัก

ใช้เทคนิค Representation-Centric แทนการเน้นแค่ปริมาณข้อมูล (Data Scaling)

ประสิทธิภาพเหนือกว่าโมเดลระดับอุตสาหกรรมในหลายการทดสอบมาตรฐาน

ใช้ GPU เพียง 16 ตัวในการฝึกสอน ช่วยลดต้นทุนการวิจัย

นวัตกรรมและเทคโนโลยี

models

Multi-embodiment Robot Pre-training

การฝึกโมเดลด้วยข้อมูลจากหุ่นยนต์หลายประเภทพร้อมกันเพื่อให้เกิดความเข้าใจแอ็กชันที่เป็นสากล

robotics

Unseen-embodiment Transfer

ความสามารถในการนำความรู้ไปใช้กับหุ่นยนต์รูปแบบใหม่ รวมถึงหุ่นยนต์ฮิวแมนนอยด์

Developer Impact
ทีมวิจัยขนาดเล็กหรือทีมพัฒนาผลิตภัณฑ์สามารถใช้แนวทางของ VLAct เพื่อสร้างโมเดลควบคุมหุ่นยนต์ประสิทธิภาพสูงได้โดยไม่ต้องพึ่งพาระบบคลาวด์คอมพิวติ้งขนาดใหญ่
Keywords
#vla #pre-training #robotics #humanoid #open-source
Original Source

อ่านข้อมูลเพิ่มเติมจากแหล่งข่าวหลัก

arXiv