ในการนำทางหุ่นยนต์เพื่อค้นหาวัตถุในสภาพแวดล้อมที่ไม่รู้จัก (Zero-shot Object Navigation) การใช้โมเดลพื้นฐานด้านภาพและภาษา (Vision-Language Foundation Models) มักประสบปัญหาเรื่องความล่าช้าในการประมวลผล ซึ่งส่งผลต่อการทำงานในสถานการณ์จริงที่เวลาเดินไปอย่างต่อเนื่อง แต่วิธีการส่วนใหญ่มักถูกพัฒนาในระบบจำลองแบบ Synchronous ที่ไม่ต้องกังวลเรื่องเวลาประมวลผล ทำให้ประสิทธิภาพลดลงเมื่อนำมาใช้งานจริง
งานวิจัยนี้จึงนำเสนอ RTNav ซึ่งเป็นสถาปัตยกรรมที่ออกแบบมาเพื่อจัดการกับความล่าช้าในการอนุมาน การรับส่งข้อมูลแบบอซิงโครนัส และข้อจำกัดของทรัพยากรคำนวณโดยเฉพาะ จากการทดสอบบนสภาพแวดล้อมจำลองที่ปรับให้เหมือนโลกจริง (Real-time variants) พบว่า RTNav สามารถเพิ่มอัตราความสำเร็จในการนำทางได้สูงสุดถึง 11% และปรับปรุงคะแนนประสิทธิภาพที่คำนึงถึงเวลาในการทำงาน (Success weighted by Completion Time) ได้ดีกว่าวิธีเดิมอย่างชัดเจน