เป้าหมายสูงสุดอย่างหนึ่งของหุ่นยนต์คือการเรียนรู้ได้ด้วยตนเอง แต่ระบบปัจจุบันมักต้องการข้อมูลจำนวนมากหรืองานสาธิตจากมนุษย์หลายครั้ง ทีมวิจัยจึงได้เสนอ 'MiDAS' ซึ่งเป็นแนวทางการปรับแต่งนโยบายหุ่นยนต์ (Robot Policy) จากข้อมูลที่น้อยที่สุด โดยใช้การผสมผสานระหว่างการทำ Behavior Cloning จากการสาธิตเพียงครั้งเดียว และการเสริมแรงผ่านระบบ Offline-to-Online Reinforcement Learning
ความโดดเด่นของ MiDAS คือการช่วยให้หุ่นยนต์สามารถเปลี่ยนจากการทำงานที่เปราะบางหลังดูตัวอย่างครั้งแรก ไปสู่การทำงานที่แข็งแรงและแม่นยำได้ภายในระยะเวลาเพียงไม่กี่ชั่วโมงของการฝึกด้วยตนเอง จากการทดสอบบนแพลตฟอร์มหุ่นยนต์แขนคู่ YAM พบว่าหุ่นยนต์สามารถพัฒนาทักษะใหม่ๆ และมีความทนทานต่ออุปสรรคมากขึ้นหลังจากเรียนรู้ผ่านการปฏิสัมพันธ์ประมาณ 6 ชั่วโมง ซึ่งถือเป็นครั้งแรกที่มีการสาธิตการปรับตัวของหุ่นยนต์ที่เชื่อถือได้จากการสาธิตเพียงครั้งเดียว