การนำทางโดรนโดยใช้ภาพและภาษา (VLN) มักเผชิญกับข้อจำกัดด้านความเร็วและประสิทธิภาพของฮาร์ดแวร์ที่ฝังตัวในตัวเครื่อง โดยทั่วไปมักต้องพึ่งพาโมเดลขนาดใหญ่หลายพันล้านพารามิเตอร์ซึ่งมีความหน่วงสูง งานวิจัยนี้เสนอ AeroDPO ซึ่งท้าทายความเชื่อเดิมด้วยการพิสูจน์ว่า คุณภาพของการรับรู้ (Perception) มีความสำคัญมากกว่าความสามารถในการใช้เหตุผลของภาษา โดยการใช้โมเดลขนาดเล็กเพียง 2B (2 พันล้านพารามิเตอร์) ที่ได้รับข้อมูลภาพคุณภาพสูง สามารถให้ผลลัพธ์เทียบเท่ากับโมเดลขนาด 7B
หัวใจสำคัญคือการนำระบบ Direct Preference Optimization (DPO) มาใช้ในรูปแบบอัตโนมัติผ่านการจำลองทางฟิสิกส์ เมื่อระบบตรวจพบการชนในโปรแกรมจำลอง ระบบจะทำการย้อนกลับ (Rollback) เพื่อเรียนรู้ว่าการตัดสินใจใดที่ผิดพลาดและสร้างการตัดสินใจที่ถูกต้องขึ้นมาใหม่โดยอัตโนมัติ วิธีการนี้ช่วยแก้ปัญหาเรื่องความเปราะบางของหุ่นยนต์ในสถานการณ์ที่ไม่เคยพบมาก่อน (Out-of-distribution) โดยไม่ต้องใช้แรงงานมนุษย์ในการระบุข้อมูล
ผลการทดสอบแสดงให้เห็นว่า AeroDPO ช่วยเพิ่มอัตราความสำเร็จในการนำทางในสภาพแวดล้อมใหม่ๆ ได้ถึง 49.16% และช่วยลดอัตราการชนได้อย่างมีนัยสำคัญ นับเป็นก้าวสำคัญสำหรับการพัฒนาโดรนอัตโนมัติที่ทำงานได้รวดเร็วบนอุปกรณ์ขนาดเล็ก