NVIDIA กำลังผลักดันการเปลี่ยนแปลงครั้งสำคัญในวงการหุ่นยนต์จาก Vision-Language-Action (VLA) ไปสู่ World Action Models (WAMs) โดยมีหัวใจหลักคือ NVIDIA Cosmos 3 ซึ่งเป็นโมเดลพื้นฐานของโลก (World Foundation Model) ข้อจำกัดของ VLA แบบเดิมคือการที่มันเรียนรู้เพียง 'คำอธิบาย' ของโลก แต่ WAMs จะเรียนรู้การ 'ทำนาย' ว่าโลกจะเปลี่ยนแปลงอย่างไรเมื่อมีการกระทำเกิดขึ้น
Cosmos 3 ใช้สถาปัตยกรรมแบบ Mixture-of-Transformers (MoT) ที่สามารถประมวลผลทั้งวิดีโอ ภาพ เสียง และการสั่งการหุ่นยนต์ไปพร้อมๆ กัน การฝึกฝนด้วยข้อมูลมหาศาลรวมถึงตัวอย่างการเคลื่อนที่ของหุ่นยนต์และวิดีโอจากโลกจริง ทำให้โมเดลนี้มีความเข้าใจด้านฟิสิกส์พื้นฐาน เช่น สิ่งของจะตกลงมาอย่างไรเมื่อถูกปล่อย หรือผ้าจะพับตัวอย่างไร สิ่งนี้ช่วยให้หุ่นยนต์ที่ใช้เทคโนโลยี WAM สามารถทำงานในสภาพแวดล้อมที่ไม่เคยเห็นมาก่อน (Zero-shot) ได้ดีกว่าเดิม และใช้ข้อมูลในการฝึกสอนทักษะใหม่น้อยลงอย่างมาก