ในการพูดคุยผ่านเวที Roundtables ของ MIT Technology Review ผู้เชี่ยวชาญได้วิเคราะห์ถึงความเสี่ยงของ AI ที่อาจส่งผลกระทบต่อชีวิตมนุษย์ ทั้งในรูปแบบของการโจมตีทางไซเบอร์ต่อโครงสร้างพื้นฐาน การสร้างเชื้อโรคสายพันธุ์ใหม่ หรือแม้แต่การที่ระบบ AI ทำงานเกินขอบเขตเพื่อบรรลุเป้าหมายโดยไม่คำนึงถึงความปลอดภัย
หัวใจสำคัญของการป้องกันคือการวิจัยเรื่อง 'Alignment' หรือการทำให้ AI ประพฤติตนตามเจตนารมณ์ของมนุษย์ ซึ่งปัจจุบันยังเป็นเรื่องยากเนื่องจากโมเดลภาษาขนาดใหญ่ (LLMs) มีความไม่แน่นอนสูงและไม่สามารถเขียนโปรแกรมควบคุมได้แบบตรงไปตรงมาเหมือนซอฟต์แวร์ทั่วไป บริษัทชั้นนำอย่าง Anthropic และ OpenAI กำลังเร่งพัฒนาวิธีการต่างๆ เช่น การตั้งกฎเกณฑ์ (Constitution) หรือการให้รางวัลพฤติกรรมที่ถูกต้อง เพื่อให้มั่นใจว่าเอเจนท์ที่ทำงานโดยอัตโนมัติจะไม่ก่อให้เกิดอันตราย