การวางแผนเส้นทางสำหรับรถยนต์ไร้คนขับเป็นโจทย์ที่ท้าทายเนื่องจากต้องการทั้งการให้เหตุผลระดับสูงและความแม่นยำในการควบคุมระดับต่ำ แม้ว่า Large Language Models (LLMs) จะโดดเด่นในด้านการให้เหตุผล แต่ที่ผ่านมายังติดปัญหาเรื่องการสร้างข้อมูลที่เป็นเท็จ (Hallucination) และขาดความเข้าใจในฟิสิกส์ของสภาพแวดล้อมจริง
GAPL (Grounded Action-effect Policy Learning) ถูกพัฒนาขึ้นเพื่อแก้ปัญหานี้ด้วยระบบวงจรปิด (Closed-loop) ที่ประกอบด้วย 3 ส่วนหลัก ได้แก่ ตัวประเมินผลลัพธ์ด้วย LLM, ตัวเชื่อมโยงผลลัพธ์ผ่านการจำลอง (Simulation-based Grounder) และตัวตัดสินใจที่เรียนรู้ผ่านนโยบาย PPO ระบบนี้จะตรวจสอบว่าสิ่งที่ LLM คาดการณ์นั้นเกิดขึ้นจริงได้หรือไม่ในเครื่องมือจำลองสถานการณ์ก่อนนำไปใช้งาน
ผลการทดสอบในสภาพแวดล้อมแบบ Highway-env พบว่า GAPL สามารถลดอัตราการชนและค่าความคลาดเคลื่อนของตำแหน่ง (ADE/FDE) ได้อย่างมีนัยสำคัญ เมื่อเทียบกับวิธีการวางแผนแบบเดิมๆ และให้ผลตอบแทน (Reward) ในระบบที่สูงขึ้น ซึ่งถือเป็นก้าวสำคัญในการนำ LLM มาใช้งานในระบบความปลอดภัยที่ต้องการความแม่นยำสูง