โครงการ VLCP (Vision Language Control Policy) นำเสนอวิธีใหม่ในการเปลี่ยนโมเดลภาษาภาพ (VLM) ให้กลายเป็นนโยบายควบคุมหุ่นยนต์โดยไม่ต้องทำการ Fine-tuning หรือใช้ข้อมูลตัวอย่าง แต่ให้ VLM ทำหน้าที่เขียนฟังก์ชันควบคุมด้วยภาษา Python สั้นๆ แทน ซึ่งแนวทางเดิมมักจะเป็นแบบ Open-loop คือเขียนโค้ดครั้งเดียวแล้วรันจนจบ แต่ VLCP พัฒนาให้เป็นแบบ Closed-loop ที่ฉลาดกว่าเดิม
หัวใจสำคัญของ VLCP คือการตรวจจับความล้มเหลวภายในตอน (Episode) เดียวกัน ทุกๆ K ขั้นตอน VLM จะสังเกตภาพจากกล้องหลายมุมและสถานะของหุ่นยนต์เพื่อเขียนโค้ดควบคุมใหม่ หากเกิดข้อผิดพลาด เช่น หยิบวัตถุพลาด ระบบจะรู้ตัวและเขียนโค้ดแก้ไขสถานการณ์ทันที ผลการทดสอบพบว่าวิธีนี้ช่วยเพิ่มอัตราความสำเร็จจาก 3.5% ในระบบเดิมเป็น 35.1% (เพิ่มขึ้น 10 เท่า) นอกจากนี้ระบบยังมีการใช้แคช (Cache) เพื่อประหยัดการใช้ Token และสร้างห้องสมุดทักษะ (Skill Library) เพื่อนำโค้ดที่เขียนไปใช้ซ้ำในอนาคตได้อีกด้วย