โมเดล Vision-Language-Action (VLA) แบบดั้งเดิมมักทำนายการเคลื่อนไหวจากข้อมูลที่เห็นในปัจจุบันเพียงอย่างเดียว ทำให้ขาดความเข้าใจในไดนามิกของงานในอนาคต ซึ่งส่งผลต่อความแม่นยำในงานที่ต้องอาศัยการสัมผัสและมีรายละเอียดสูง ทีมวิจัยจึงเสนอ PHR-VLA ซึ่งเป็นกรอบการทำงานที่เพิ่ม 'ส่วนหัวช่วยคาดการณ์อนาคต' (Auxiliary future head) ขนาดเล็กเข้าไปในโมเดล
ในช่วงการฝึกสอน (Training) ส่วนหัวนี้จะทำการปรับจูนการนำเสนอข้อมูลภายในของโมเดล (Internal representations) ให้สอดคล้องกับภาพเหตุการณ์ที่จะเกิดขึ้นในอนาคต ผลการทดสอบแสดงให้เห็นว่าการใช้ข้อมูลภาพจากกล้องที่ติดอยู่กับข้อมือหุ่นยนต์ (Wrist camera) ช่วยเพิ่มอัตราความสำเร็จในการทดสอบ LIBERO จาก 84.1% เป็น 88.4% และเพิ่มความสำเร็จในงานถอดประกอบชิ้นส่วนในโลกจริงจาก 63.3% เป็น 82.5% อย่างมีนัยสำคัญ