งานวิจัยนี้ศึกษาการปรับปรุงประสิทธิภาพของระบบบริการ Large Language Model (LLM) แบบแยกส่วน (Disaggregated Serving) ซึ่งมีการแยกการประมวลผลส่วน prefill (คำนวณหนัก) และ decode (ใช้หน่วยความจำสูง) ออกจากกันใน GPU คนละกลุ่ม โดยปัญหาหลักอยู่ที่การจัดเส้นทาง (Routing) คำขอไปยังอินสแตนซ์ที่เหมาะสม ผู้วิจัยจึงเสนอระบบเราเตอร์ที่ใช้วิธีประเมินเวลาการทำงานส่วนเกินจากปัจจัยต่างๆ เช่น ความยาวของ prompt, การคาดการณ์ความยาวของ output, แรงกดดันของ KV cache และระดับ SLO
จากการทดสอบในเครื่องจำลองและตรวจสอบกับ GPU NVIDIA A40 จำนวน 8 ตัว พบว่าเราเตอร์ที่ผ่านการปรับเทียบแล้วสามารถทำค่าเฉลี่ย goodput ได้สูงสุดที่ 0.864 เมื่อเทียบกับวิธีดั้งเดิมอย่าง round robin หรือ least loaded นอกจากนี้ยังพบว่าการปรับเทียบฮาร์ดแวร์มีความสำคัญมาก หากใช้ค่าคงที่จากเครื่องจำลองเพียงอย่างเดียวจะทำให้ประสิทธิภาพลดลงอย่างเห็นได้ชัด ระบบนี้จะมีประโยชน์อย่างยิ่งเมื่อขนาดของกลุ่ม GPU สำหรับ decode ใหญ่ขึ้นและมีลักษณะการใช้งานที่หลากหลาย