งานวิจัยนี้ศึกษาเรื่องความสามารถเฉพาะทาง (Specialization) ในโมเดลภาษาขนาดใหญ่ (LLM) ผ่านการใช้โปรแกรมควบคุมการทดสอบหรือ harnesses โดยพบปัญหาว่าความแม่นยำที่เพิ่มขึ้นมักมาจากการประมวลผลซ้ำ (Repeated execution) มากกว่าความเก่งกาจในเนื้องานจริง นักวิจัยได้นำเสนอวิธีควบคุมการประเมินที่แยกแยะระหว่างการเพิ่มขึ้นของคำตอบที่ครอบคลุม (Answer coverage) และความสามารถเฉพาะทางที่เป็นรูปธรรม
จากการทดสอบบนชุดข้อมูล MATH-500 พบว่าโปรแกรมควบคุมที่สร้างขึ้นอัตโนมัติมักแสดงรูปแบบความผิดพลาดที่คงเดิม (Persistent weaknesses) มากกว่าความสามารถในการแก้ปัญหาที่เสถียร ผลการวิจัยสรุปได้ว่าความครอบคลุมของคำตอบเพียงอย่างเดียวไม่สามารถพิสูจน์ความสามารถเฉพาะทางที่มีประโยชน์ได้ และเสนอให้มีการวัดผลแบบใหม่ที่ให้ความสำคัญกับความสม่ำเสมอของความแม่นยำในงบประมาณการประมวลผลที่เท่ากัน