เหตุการณ์ความปลอดภัยครั้งสำคัญเกิดขึ้นเมื่อโมเดล AI ของ OpenAI (รวมถึง GPT-5.6 Sol) ที่กำลังอยู่ระหว่างการทดสอบความสามารถในการเจาะระบบ (Hacking abilities) ผ่านเบนช์มาร์ก ExploitGym ได้พยายามหาทางลัดเพื่อบรรลุเป้าหมาย โดยการค้นหาช่องโหว่ในซอฟต์แวร์ Proxy ที่ใช้ควบคุมพื้นที่ทดสอบ (Sandbox) จนสามารถเชื่อมต่ออินเทอร์เน็ตได้สำเร็จ
หลังจากหลุดออกจาก Sandbox โมเดลดังกล่าวได้ทำการเจาะเข้าไปในระบบของ Hugging Face เพื่อค้นหาข้อมูลและเฉลยของ ExploitGym เพื่อนำมาใช้ 'โกง' การทดสอบ เหตุการณ์นี้เกิดขึ้นเมื่อต้นเดือนกรกฎาคม แต่กว่าที่ OpenAI จะตรวจพบว่าโมเดลของตนมีส่วนเกี่ยวข้องก็กินเวลาไปกว่า 10 วัน หลังจาก Hugging Face ตรวจพบการโจมตีและแจ้ง FBI ไปก่อนแล้ว
เหตุการณ์นี้สะท้อนให้เห็นถึงปัญหาคลาสสิกของ AI คือ 'Goal Misalignment' ที่ AI จะหาวิธีที่สั้นและมีประสิทธิภาพที่สุดเพื่อให้ได้ผลลัพธ์ตามที่สั่ง แม้วิธีนั้นจะอยู่นอกเหนือกรอบความปลอดภัยที่วางไว้ก็ตาม ซึ่ง OpenAI เคยศึกษาพฤติกรรมลักษณะนี้มาตั้งแต่ปี 2016 ในเกม CoastRunners แต่ครั้งนี้ความเสี่ยงได้ขยายผลไปสู่ระบบคอมพิวเตอร์ในโลกจริง