ROBOTICS & HUMANOID

VLAff: โมเดล Vision-Language สำหรับการคาดการณ์พฤติกรรมหุ่นยนต์จากวิดีโอมุมมองบุคคลที่หนึ่ง

arXiv07 Aug 2026
1 min read
Key Takeaways
  • VLAff ช่วยให้หุ่นยนต์เรียนรู้วิธีการโต้ตอบกับวัตถุจากวิดีโอคนได้โดยตรงผ่านแนวคิด Affordance ซึ่งรองรับการทำงานแบบ Zero-shot และเพิ่มประสิทธิภาพในการเรียนรู้ทักษะใหม่

ทำไมเรื่องนี้ถึงสำคัญ

งานวิจัยนี้ช่วยลดช่องว่างในการนำวิดีโอการใช้ชีวิตประจำวันของมนุษย์มาฝึกฝนหุ่นยนต์ ซึ่งเป็นแหล่งข้อมูลที่หาได้ง่ายและมีปริมาณมหาศาล ทำให้หุ่นยนต์สามารถเรียนรู้ทักษะใหม่ๆ ได้อย่างรวดเร็วและมีความยืดหยุ่นสูงขึ้นในสภาพแวดล้อมที่หลากหลาย

นักวิจัยนำเสนอ VLAff (Vision-Language-Affordance) ซึ่งเป็นโมเดลภาษาและภาพขนาดใหญ่ที่ออกแบบมาเพื่อแก้ปัญหาความแตกต่างระหว่างร่างกายของมนุษย์และหุ่นยนต์ในการเรียนรู้ทักษะการทำงาน โดยเปลี่ยนมาเน้นที่การเรียนรู้ 'Actionable Affordances' หรือคุณลักษณะของวัตถุที่บ่งบอกถึงพฤติกรรมการใช้งานที่เหมาะสม ซึ่งไม่ขึ้นอยู่กับโครงสร้างร่างกายของผู้กระทำ

หัวใจสำคัญของงานวิจัยนี้คือการสร้างชุดข้อมูล EgoAffordance ที่รวบรวมจากวิดีโอมุมมองบุคคลที่หนึ่งของมนุษย์จำนวนกว่า 204,000 คลิป ซึ่งประกอบด้วยข้อมูลการปฏิสัมพันธ์กับวัตถุ การหยิบจับ และวิถีการเคลื่อนที่จำนวนมหาศาล โมเดล VLAff จะนำข้อมูลเหล่านี้มาเรียนรู้ความสัมพันธ์ข้ามโหมด (Cross-modal) เพื่อสร้างแผนภูมิความร้อน (Heatmap) ของจุดที่ควรโต้ตอบ ท่าทางการหยิบจับ และวิถีการเคลื่อนที่ของหุ่นยนต์จากคำสั่งเสียงหรือภาพที่ได้รับ

สรุปประเด็นหลัก

เปิดตัวชุดข้อมูล EgoAffordance ที่มีข้อมูลการหยิบจับและวิถีการเคลื่อนที่กว่า 11.6 ล้านรายการ

VLAff สามารถสร้างแผนภูมิความร้อนและท่าทางการหยิบจับที่หุ่นยนต์สามารถนำไปใช้ปฏิบัติงานจริงได้ทันที

ผลการทดสอบยืนยันประสิทธิภาพในระดับ State-of-the-art ทั้งในด้านการคาดการณ์และการนำไปใช้กับหุ่นยนต์จริง

นวัตกรรมและเทคโนโลยี

research

EgoAffordance Dataset

ชุดข้อมูลขนาดใหญ่ 204K ตอนที่สกัดจากวิดีโอมุมมองบุคคลที่หนึ่งของมนุษย์ เพื่อใช้เรียนรู้การหยิบจับและเคลื่อนที่

models

VLAff Foundation Model

โมเดล Vision-Language ที่รวมการคาดการณ์พฤติกรรมการใช้งานวัตถุ (Visual, Grasp, Trajectory) ไว้ในระบบเดียว

Developer Impact
นักพัฒนาด้านหุ่นยนต์สามารถนำแนวคิดการฝึกด้วยวิดีโอคนมาปรับใช้เพื่อลดต้นทุนการเก็บข้อมูล และใช้แผนภูมิ Affordance เพื่อช่วยในการวางแผนการเคลื่อนที่ของหุ่นยนต์ได้แม่นยำขึ้น
Keywords
#robotics #vlm #affordance #computer vision #actionable affordances
Original Source

อ่านข้อมูลเพิ่มเติมจากแหล่งข่าวหลัก

arXiv