ปัญหาใหญ่ประการหนึ่งในการประเมินโมเดล AI คือ 'การปนเปื้อนของเกณฑ์มาตรฐาน' (Benchmark Contamination) ซึ่งเกิดขึ้นหากโมเดลเคยเห็นคำถามในชุดทดสอบมาก่อนในระหว่างการฝึกฝน ทำให้ผลคะแนนที่ออกมาไม่สะท้อนความสามารถที่แท้จริง Google DeepMind จึงนำเสนอการประเมินแบบ Double-blind ครั้งแรกของโลก
กระบวนการนี้ใช้เทคโนโลยี Confidential Computing ผ่าน 'Confidential Space' บน Google Cloud เพื่อสร้างพื้นที่การประเมินที่เข้ารหัสอย่างแน่นหนา โดยที่ผู้ประเมินภายนอกไม่สามารถมองเห็นน้ำหนัก (Weights) ของโมเดล และ Google เองก็ไม่สามารถมองเห็นคำถามหรือพรอมต์ในชุดทดสอบได้ วิธีนี้ช่วยให้องค์กรอิสระสามารถตรวจสอบความปลอดภัยและประสิทธิภาพของโมเดล AI ระดับสูงได้โดยไม่ต้องกังวลเรื่องการละเมิดทรัพย์สินทางปัญญาหรือการโกงผลการทดสอบ