ความท้าทายในการฝึกแบบจำลองกล้ามเนื้อและกระดูกของมนุษย์ (Musculoskeletal System) คือการมีจำนวนกล้ามเนื้อที่มากเกินความจำเป็น (Overactuation) ทำให้การเรียนรู้ด้วย Reinforcement Learning แบบเดิมทำได้ยากและใช้เวลานาน งานวิจัยนี้จึงนำเสนอระบบควบคุมที่เรียกว่า "Lambda-hold controller" ซึ่งได้รับแรงบันดาลใจจากสมมติฐานจุดสมดุล (Equilibrium-Point Hypothesis) ของการควบคุมการเคลื่อนไหวในมนุษย์
ระบบนี้จะใช้ตัวแปรควบคุมคือค่าความยาวเกณฑ์ (Threshold Length - λ) ของกล้ามเนื้อแต่ละมัด เพื่อให้ระบบตอบสนองแบบการสะท้อนกลับ (Stretch-reflex) อัตโนมัติ แทนที่จะต้องสั่งการกล้ามเนื้อทุกมัดตลอดเวลา นอกจากนี้ยังมีการใช้เทคนิคการคงค่า λ ไว้ในช่วงจังหวะการก้าว (Gait phase) เพื่อลดความถี่ในการประมวลผล ผลลัพธ์ที่ได้คือแบบจำลองสามารถเรียนรู้การวิ่ง (Sprinting) ที่เหมือนมนุษย์ได้อย่างรวดเร็วภายในเวลาไม่ถึง 1 ชั่วโมง โดยใช้ระบบให้รางวัล (Reward) ที่เรียบง่ายที่สุด ซึ่งถือเป็นความก้าวหน้าสำคัญในการสร้างแบบจำลองการเคลื่อนไหวที่มีประสิทธิภาพสูง