การประเมินประสิทธิภาพของ AI Agents ขนาดใหญ่มักประสบปัญหาเรื่อง 'การให้คะแนนเกินจริง' (Over-crediting) เมื่อใช้โมเดลภาษาอื่นมาเป็นผู้ตัดสิน (LLM Judge) เนื่องจากบ่อยครั้งที่โมเดลตัดสินมักจะให้คะแนนเอเจนต์ที่เขียนโปรแกรมคล่องแคล่วแต่ทำงานไม่สำเร็จว่าเป็นผู้ชนะ
RubricForge แก้ปัญหานี้โดยการใช้กระบวนการวิวัฒนาการเชิงสะท้อน (Reflective Evolution) เพื่อสร้างข้อความเกณฑ์การตัดสินที่อิงจากข้อมูลการทำงานที่ทราบผลลัพธ์จริง (Ground-truth) เกณฑ์ที่ได้จะเป็นข้อความที่มนุษย์สามารถอ่านและตรวจสอบได้ ช่วยให้เราทราบว่าทำไมเอเจนต์ถึงถูกให้คะแนนแบบนั้น ผลการทดสอบพบว่า RubricForge สามารถลดอัตราการปล่อยให้เอเจนต์ที่ล้มเหลวผ่านการประเมิน (False-pass rate) ได้ถึงเกือบครึ่งหนึ่งเมื่อเทียบกับวิธีการประเมินแบบทั่วไป