AI & MACHINE LEARNING

ต้นทุนของการกำหนดขอบเขต Token: การวัดประสิทธิภาพการบีบอัดและการคาดการณ์ในโมเดลภาษา

arXiv30 Sep 2026
1 min read
Key Takeaways
  • การกำหนดขอบเขตคำใน Tokenizer มีราคาที่ต้องจ่ายเป็นประสิทธิภาพในการบีบอัดข้อมูลที่หายไปกว่า 30%

ทำไมเรื่องนี้ถึงสำคัญ

ช่วยให้ผู้พัฒนาโมเดลภาษา (LLM) เข้าใจถึงข้อจำกัดของ Tokenizer แบบเดิม และชี้ทางเลือกใหม่ในการเพิ่มประสิทธิภาพการประมวลผลข้อมูลที่ประหยัดทรัพยากรมากขึ้น

งานวิจัยชิ้นนี้ศึกษาผลกระทบของการทำ Pre-tokenisation หรือการกำหนดขอบเขตของหน่วยคำล่วงหน้าที่มีต่อประสิทธิภาพของโมเดลภาษา โดยพบว่าการกำหนดขอบเขตเหล่านี้ขัดขวางไม่ให้โมเดลเลือกใช้หน่วยคำที่บีบอัดข้อมูลได้ดีที่สุด จากการทดสอบบน Wikipedia ภาษาอังกฤษ พบว่าขอบเขตคำทำให้จำนวน Token ที่ต้องใช้เพิ่มขึ้นถึง 28.3-36.8% เมื่อเทียบกับการไม่กำหนดขอบเขตเลย

นอกจากนี้ งานวิจัยยังพบว่า 'ประสิทธิภาพการบีบอัด' และ 'คุณภาพการคาดการณ์' มักจะขัดแย้งกันในการเลือกใช้พจนานุกรมคำศัพท์ อย่างไรก็ตาม นักวิจัยได้นำเสนอแนวทาง 'Boundary Licences' ซึ่งเป็นการอนุญาตให้คำศัพท์บางส่วนสามารถข้ามขอบเขตคำได้ ซึ่งพบว่าเพียงแค่อนุญาตให้ใช้คำศัพท์ข้ามขอบเขตได้เพียง 10% ก็สามารถลดจำนวน Token ได้เกือบเท่ากับการยกเลิกขอบเขตทั้งหมด

สรุปประเด็นหลัก

ขอบเขตคำทำให้จำนวน Token ที่เหมาะสมที่สุดเพิ่มขึ้น 28.3-36.8% ในภาษาอังกฤษ

Byte Pair Encoding (BPE) มีประสิทธิภาพต่ำกว่าจุดที่ควรจะเป็นถึง 10.9% หากไม่จำกัดขอบเขต

การใช้ Boundary Licences เพียง 10% ช่วยกู้คืนประสิทธิภาพการบีบอัดกลับมาได้เกือบทั้งหมด

นวัตกรรมและเทคโนโลยี

infrastructure

Boundary Licences

นโยบายการจัดการพจนานุกรมคำศัพท์ที่ยอมให้บางคำข้ามขอบเขตที่กำหนดไว้เพื่อเพิ่มประสิทธิภาพการบีบอัด

Developer Impact
ช่วยให้นักพัฒนาที่ออกแบบ Tokenizer สามารถปรับสมดุลระหว่างความหมายของภาษาและประสิทธิภาพการประมวลผลได้ดีขึ้น โดยเฉพาะในงานที่เน้นประสิทธิภาพการบีบอัด
Keywords
#tokenization #bpe #data compression #nlp
Original Source

อ่านข้อมูลเพิ่มเติมจากแหล่งข่าวหลัก

arXiv