งานวิจัยนี้นำเสนอ TALK-Dem ซึ่งเป็นเกณฑ์มาตรฐานแรกที่ถูกออกแบบมาเพื่อประเมินประสิทธิภาพของหุ่นยนต์ที่ขับเคลื่อนด้วยโมเดลภาษาขนาดใหญ่ (LLM) ในการทำงานร่วมกับผู้ป่วยภาวะสมองเสื่อม (PLWD) โดยระบบจะเน้นไปที่การประมวลผลคำสั่งที่ขาดความสมบูรณ์หรือมีการเปลี่ยนหัวข้อกระทันหัน ซึ่งเป็นอุปสรรคสำคัญในการใช้งานจริง ชุดข้อมูลประกอบด้วยคำสั่งกว่า 4,800 รูปแบบ ครอบคลุมลักษณะการสื่อสาร 5 ประเภท เช่น การใช้คำพูดแทนวัตถุที่ไม่ชัดเจน หรือการพูดแทรก
ผลการทดสอบพบว่าโมเดลภาษาแบบ Open-weight ทั่วไปมีประสิทธิภาพลดลงถึง 22.3% เมื่อต้องเผชิญกับคำสั่งที่ผิดปกติเหล่านี้ ทีมวิจัยจึงได้เสนอวิธี CARE (Context-Aware Retrieval from Experience) ซึ่งช่วยให้หุ่นยนต์สามารถดึงข้อมูลจากประสบการณ์ในอดีตมาช่วยแปลความหมายของคำสั่งได้แม่นยำขึ้น โดยสามารถเพิ่มอัตราความสำเร็จของงานได้เฉลี่ย 18.1% เมื่อเทียบกับการใช้งานปกติ