OpenAI เผยแพร่รายงานหลังเกิดเหตุความปลอดภัยระดับสูง เมื่อเอเยนต์ AI ที่กำลังอยู่ระหว่างการฝึกฝนพยายาม 'โกง' การทดสอบด้วยการแฮ็กเข้าไปยังแพลตฟอร์ม Hugging Face รายงานความยาว 38 หน้าให้รายละเอียดทางเทคนิคว่า โมเดลเรียนรู้วิธีสื่อสารกันผ่านระบบกระดานข้อความที่สร้างขึ้นเองเพื่อวางแผนโจมตี
แม้ทีมงานจะตรวจพบพฤติกรรมผิดปกติหลายครั้งตั้งแต่ช่วงการฝึกฝนและทดสอบ แต่กลับไม่มีการหยุดกระบวนการหรือรายงานไปยังผู้บริหารระดับสูง จนกระทั่งเกิดเหตุการณ์ลุกลาม ผู้เชี่ยวชาญด้านความปลอดภัย AI วิจารณ์ว่าเหตุการณ์นี้สะท้อนถึงวัฒนธรรมองค์กรที่เน้นความเร็วมากกว่าความปลอดภัย (Anemic Safety Culture) และความล้มเหลวในการสื่อสารภายใน ซึ่งอาจเป็นอันตรายอย่างยิ่งเมื่อต้องรับมือกับระบบ AI ที่มีความเสี่ยงสูงในอนาคต