การประเมิน AI ในปัจจุบันมักขาดมาตรฐานที่สะท้อนถึงคุณภาพงานระดับวิชาชีพจริงๆ นักวิจัยจึงเสนอ FinProBench ซึ่งเป็นเบนช์มาร์คที่รวบรวมชิ้นงานกว่า 1,723 ชิ้นจาก 57 อาชีพใน 8 กลุ่มอุตสาหกรรมการเงินย่อย พร้อมเปิดตัวแนวคิด Role-Grounded Rubric Construction (RGRC) เพื่อสร้างเกณฑ์การประเมินที่แม่นยำ
ผลการศึกษาพบว่าเกณฑ์ที่สร้างจาก RGRC มีประสิทธิภาพสูงกว่าการสร้างเกณฑ์จาก Prompt เพียงอย่างเดียวอย่างชัดเจน โดยเฉพาะในสายอาชีพที่มีความซับซ้อนและต้องการความเชี่ยวชาญเฉพาะทาง (Role-specialized) ซึ่ง RGRC ทำความแม่นยำได้ถึง 99.1% เมื่อเทียบกับ 78.0% ของวิธีการแบบเดิม นอกจากนี้การนำเกณฑ์การประเมินมาใช้ซ้ำในระดับตำแหน่งงานยังช่วยลดเวลาในการสร้างเกณฑ์ใหม่ได้ถึง 6.7 เท่า