งานวิจัยฉบับนี้วิเคราะห์ปัญหาของเกณฑ์การประเมินความสามารถในการสรุปความเชิงระบบ (Systematic Generalization) ในปัจจุบัน ซึ่งมักจะตัดทอนความซับซ้อนบางอย่างออกไปทำให้การวัดผลไม่ครอบคลุม ผู้วิจัยจึงได้พัฒนา TranSGrid ซึ่งเป็นชุดทดสอบที่รวมการใช้เหตุผลแบบอุปนัย (Inductive), นิรนัย (Deductive) และการอนุมาน (Abductive) เข้าด้วยกันไว้ในภารกิจเดียว
จากการทดสอบกับโมเดล Transformer จำนวน 7 รุ่น พบว่าแม้แต่โมเดลขนาดใหญ่ที่สุดที่สามารถทำคะแนนในชุดทดสอบทั่วไปได้ถึง 79.6% กลับทำคะแนนใน TranSGrid ได้เพียง 55.3% และทำได้เพียง 15.8% ในส่วนที่ยากที่สุด ผลลัพธ์นี้ชี้ให้เห็นว่าลำพังเพียงความสามารถในการประมวลผลข้อมูลที่ยาวขึ้น (Productivity) ไม่เพียงพอต่อการวัดผลการสรุปความเชิงระบบ และความท้าทายที่แท้จริงอยู่ที่การรักษาระดับความต้องการในการใช้เหตุผลทั้งสามรูปแบบพร้อมกัน