งานวิจัยนี้ศึกษาถึงข้อจำกัดของการสุ่มตัวอย่างเชิงสถิติ (Stochastic Sampling) ในโมเดลภาษาขนาดใหญ่ โดยเปรียบเทียบระหว่างการรันโมเดลเดียวซ้ำ 100 ครั้งที่ค่า Temperature สูง กับการใช้กลุ่มโมเดลที่แตกต่างกัน 24 โมเดล (Ensemble) พบว่าการรันซ้ำในโมเดลเดียวช่วยเพียงแค่การประมาณความมั่นใจของคำตอบรายข้อเท่านั้น แต่ไม่สามารถสะท้อนถึงโครงสร้างความไม่แน่นอนที่สัมพันธ์กันระหว่างคำถามต่างๆ ได้
จากการทดสอบบนเบนช์มาร์ก MMLU, HellaSwag และ GSM8K พบว่าความแปรปรวนจากการสุ่มภายในโมเดลเดียวแทบไม่มีสัญญาณของ 'ความหลากหลายทางความรู้' (Epistemic Diversity) ในขณะที่การใช้โมเดลหลายตัวทำงานร่วมกันสามารถเปิดเผยถึงสิ่งที่โมเดลไม่รู้ได้อย่างชัดเจนและเป็นระบบมากกว่า