โมเดล Vision-Language-Action (VLA) ในปัจจุบันมักมองข้ามความสำคัญที่แตกต่างกันระหว่างมุมมองภาพรวมและมุมมองจากกล้องที่ติดบนตัวหุ่นยนต์ งานวิจัยชิ้นนี้จึงเสนอโมเดล W2-VLA ซึ่งเน้นการประมวลผลที่เชื่อมโยงระหว่างมุมมองโลกกว้างและบริบทเฉพาะหน้าของข้อมือหุ่นยนต์ โดยการสร้างอินเทอร์เฟซโทเคนแฝง (Latent tokens) ที่ทำหน้าที่เป็นสะพานเชื่อมระหว่างข้อมูลภาพและตัวทำนายการเคลื่อนไหว
ระบบนี้จะทำนายสถานะในอนาคตของข้อมือ (Future wrist latents) เพื่อนำมาใช้เป็นข้อมูลประกอบในการตัดสินใจสั่งการ (Action prediction) นอกจากนี้ยังมีการเปิดตัว W2-CoT ซึ่งเป็นกระบวนการสร้างชุดข้อมูลคำอธิบายความคืบหน้าของงานและสัญญาณการเปลี่ยนแปลงทางกายภาพ เพื่อช่วยในการฝึกฝนโมเดลให้มีความฉลาดและเข้าใจบริบทของการทำงานมากขึ้น