การสร้างโมเดลโลก (World Model) ที่สามารถทำนายผลลัพธ์จากการกระทำของหุ่นยนต์ในระยะยาวถือเป็นเรื่องยาก งานวิจัยนี้เปิดตัว WALL-SS ซึ่งใช้สถาปัตยกรรมที่ประมวลผลแบบเป็นลำดับขั้น (Scale-wise autoregressive Scaling) เพื่อสร้างภาพอนาคตจากหยาบไปละเอียด ทำให้สามารถจำลองเหตุการณ์ได้ต่อเนื่องและยาวนานขึ้น
จุดเด่นของ WALL-SS คือการเชื่อมโยง 'การกระทำ' เข้ากับ 'ผลลัพธ์' ได้อย่างเหนียวแน่น (Action-future coupling) และมีความสามารถในการจดจำเหตุการณ์ที่ผ่านพ้นไปนานแล้วผ่านระบบหน่วยความจำแบบบีบอัด นอกจากนี้ยังมีกระบวนการ On-policy alignment ที่ช่วยลดปัญหาความคลาดเคลื่อนของการกระทำ (Action drift) ทำให้หุ่นยนต์จำลองสามารถทำงานได้อย่างสอดคล้องกับความเป็นจริงแม้จะจำลองสถานการณ์ยาวนานเป็นนาที