ในงานวิจัยนี้ ทีมงานได้สร้างระบบทดสอบชื่อ 'Vibe Patenting' เพื่อประเมินประสิทธิภาพของ LLM ในฐานะกรรมการ (Judge) สำหรับงานวิชาชีพที่ซับซ้อนอย่างการร่างสิทธิบัตร ระบบนี้จะให้ LLM Judge ตรวจสอบร่างสิทธิบัตรที่สร้างโดย AI และให้ข้อเสนอแนะเชิงโครงสร้างเพื่อนำไปปรับปรุงในรอบถัดไป
ผลการศึกษาพบว่าการให้ Judge ช่วยแนะนำการแก้ไขแบบวนซ้ำ (Iterative Revision) ช่วยเพิ่มคุณภาพงานได้อย่างต่อเนื่อง ซึ่งแตกต่างจากการแก้ไขโดยไม่มีคำแนะนำที่มักจะถึงจุดอิ่มตัวอย่างรวดเร็ว นอกจากนี้ยังพบว่าโมเดลที่มีความสามารถในการใช้เหตุผลต่ำ (Low-reasoning) เมื่อได้รับการชี้แนะจาก Judge ที่ดี จะสามารถทำผลงานได้ใกล้เคียงกับโมเดลราคาแพงที่มีประสิทธิภาพสูงกว่า อย่างไรก็ตาม การตรวจสอบความถูกต้องกับทนายความด้านสิทธิบัตรมืออาชีพพบว่า แม้ LLM Judge จะมีประโยชน์ แต่ก็ยังมีข้อจำกัดเรื่องความคลาดเคลื่อนในการวัดผลที่ขึ้นอยู่กับตัวชี้วัดเฉพาะทาง