การควบคุมหุ่นยนต์ด้วยโมเดล Vision-Language-Action (VLA) มักประสบปัญหาเมื่อต้องเผชิญกับสภาพแวดล้อมที่หลากหลาย เนื่องจากโมเดลเดียวมักมีประสิทธิภาพจำกัดในบางสถานะของงาน นักวิจัยจึงได้นำเสนอ StepWise Action Policy Routing (SWAP) ซึ่งเป็นเฟรมเวิร์กที่เปลี่ยนจากการพึ่งพานโยบายการควบคุม (Policy) เพียงชุดเดียว มาเป็นการเลือกใช้หลายนโยบายร่วมกันอย่างชาญฉลาด
SWAP ใช้การเรียนรู้แบบ Offline Reinforcement Learning เพื่อสร้างตัวตัดสินใจ (Routing Critic) ที่จะวิเคราะห์ภาพที่หุ่นยนต์เห็นในขณะนั้นแล้วเลือกนโยบายการควบคุมที่เหมาะสมที่สุดมาใช้งานแบบออนไลน์ ผลการทดสอบในงานหยิบจับหุ่นยนต์จริงและในระบบจำลองพบว่า SWAP ช่วยเพิ่มอัตราความสำเร็จในการทำงานได้สูงสุดถึง 33% และลดจำนวนขั้นตอนที่หุ่นยนต์ต้องใช้ในการทำงานลงได้ถึง 28.3% ทำให้การเคลื่อนไหวมีความกระชับและแม่นยำมากขึ้น