การใส่ลายน้ำในผลลัพธ์จากโมเดลภาษาขนาดใหญ่ (LLM) มีความสำคัญต่อการตรวจสอบที่มาของข้อมูล แต่การศึกษานี้พบว่าในโดเมนเฉพาะทางอย่างการแพทย์ การเปลี่ยนแปลงเพียงเล็กน้อยในระดับ Token เพื่อใส่ลายน้ำสามารถนำไปสู่ความผิดพลาดทางความหมายที่รุนแรงได้ ผลการทดสอบแผนการใส่ลายน้ำ 5 รูปแบบกับโมเดลภาษาและโมเดลวิเคราะห์ภาพรวม 18 รุ่น พบว่าประสิทธิภาพของโมเดลลดลงอย่างมีนัยสำคัญในงานวิเคราะห์อาการทางคลินิก
ข้อบกพร่องที่พบรวมถึงการเกิดภาวะ 'อาการหลอน' ของคำศัพท์ (Hallucinated Terminology), การคลาดเคลื่อนในการระบุตำแหน่งจากภาพถ่ายทางการแพทย์ และการละเลยรายละเอียดสำคัญในการวินิจฉัย งานวิจัยนี้เสนอว่าความปลอดภัยในทางการแพทย์จำเป็นต้องมีการประเมินผลเฉพาะทางอย่างเข้มงวด แทนที่จะใช้เพียงตัวชี้วัดความถูกต้องแบบกว้างๆ ทั่วไป