นักวิจัยจากมหาวิทยาลัยพรินซ์ตันและมหาวิทยาลัยชิคาโกได้ทำการทดลองผ่านเกมจำลองการจ้างงานกับโมเดล AI ชั้นนำ เช่น ChatGPT, Claude และ Gemini พบว่าโมเดลเหล่านี้มีแนวโน้มที่จะสร้างอคติและภาพจำ (Stereotype) ต่อผู้สมัครงานตามกลุ่มชาติพันธุ์มากกว่ามนุษย์อย่างมีนัยสำคัญ แม้จะมีการตั้งค่าให้ผู้สมัครทุกคนมีโอกาสประสบความสำเร็จเท่ากัน แต่ AI มักจะด่วนสรุปจากผลลัพธ์ในช่วงแรกและเริ่มแบ่งแยกงานตามกลุ่มประชากร เช่น หากพบว่าคนกลุ่มหนึ่งล้มเหลวในอาชีพแพทย์ AI จะเริ่มจัดส่งคนกลุ่มนั้นไปทำงานในตำแหน่งที่ใช้ทักษะน้อยกว่าทันที
สิ่งที่น่ากังวลคือโมเดลรุ่นใหม่ที่มีความสามารถด้านเหตุผลสูงอย่าง o3 ของ OpenAI และ R1 ของ DeepSeek กลับแสดงอคติที่รุนแรงกว่ารุ่นก่อนๆ โดยทำคะแนนด้านการแบ่งแยกบนมาตรวัดทางจิตวิทยาสูงกว่ามนุษย์ถึง 65% สาเหตุหลักเกิดจากการที่ LLM ถูกปรับแต่งให้เก่งในการหาข้อสรุปทั่วไปจากข้อมูลจำนวนน้อย (Generalization) ซึ่งเป็นทักษะที่ใช้ได้ดีในงานคณิตศาสตร์หรือเขียนโปรแกรม แต่กลับสร้างผลลัพธ์ที่อันตรายเมื่อนำมาใช้ในบริบททางสังคมและการตัดสินใจเรื่องทรัพยากรมนุษย์