งานวิจัยชิ้นนี้ศึกษาผลกระทบของการทำ Pre-tokenisation หรือการกำหนดขอบเขตของหน่วยคำล่วงหน้าที่มีต่อประสิทธิภาพของโมเดลภาษา โดยพบว่าการกำหนดขอบเขตเหล่านี้ขัดขวางไม่ให้โมเดลเลือกใช้หน่วยคำที่บีบอัดข้อมูลได้ดีที่สุด จากการทดสอบบน Wikipedia ภาษาอังกฤษ พบว่าขอบเขตคำทำให้จำนวน Token ที่ต้องใช้เพิ่มขึ้นถึง 28.3-36.8% เมื่อเทียบกับการไม่กำหนดขอบเขตเลย
นอกจากนี้ งานวิจัยยังพบว่า 'ประสิทธิภาพการบีบอัด' และ 'คุณภาพการคาดการณ์' มักจะขัดแย้งกันในการเลือกใช้พจนานุกรมคำศัพท์ อย่างไรก็ตาม นักวิจัยได้นำเสนอแนวทาง 'Boundary Licences' ซึ่งเป็นการอนุญาตให้คำศัพท์บางส่วนสามารถข้ามขอบเขตคำได้ ซึ่งพบว่าเพียงแค่อนุญาตให้ใช้คำศัพท์ข้ามขอบเขตได้เพียง 10% ก็สามารถลดจำนวน Token ได้เกือบเท่ากับการยกเลิกขอบเขตทั้งหมด