CLOUD & INFRA

Calibrate, Then Route: ระบบเราเตอร์อัจฉริยะเพิ่มประสิทธิภาพการให้บริการ LLM แบบแยกส่วน

arXiv16 Sep 2026
1 min read
Key Takeaways
  • เราเตอร์ที่ผ่านการปรับเทียบฮาร์ดแวร์จริงสามารถจัดการคิวงาน LLM ได้ดีกว่าวิธีทั่วไป ช่วยให้ระบบใช้ทรัพยากรน้อยลงแต่ได้ผลผลิตงานที่มากขึ้น

ทำไมเรื่องนี้ถึงสำคัญ

ประสิทธิภาพในการให้บริการ LLM เป็นปัจจัยสำคัญในการลดต้นทุนและเพิ่มประสบการณ์ผู้ใช้ การพัฒนาเราเตอร์ที่สามารถคาดการณ์ภาระงานได้แม่นยำช่วยให้การใช้ทรัพยากร GPU มีประสิทธิภาพสูงสุด ซึ่งเป็นหัวใจสำคัญของระบบ AI infrastructure ขนาดใหญ่

งานวิจัยนี้ศึกษาการปรับปรุงประสิทธิภาพของระบบบริการ Large Language Model (LLM) แบบแยกส่วน (Disaggregated Serving) ซึ่งมีการแยกการประมวลผลส่วน prefill (คำนวณหนัก) และ decode (ใช้หน่วยความจำสูง) ออกจากกันใน GPU คนละกลุ่ม โดยปัญหาหลักอยู่ที่การจัดเส้นทาง (Routing) คำขอไปยังอินสแตนซ์ที่เหมาะสม ผู้วิจัยจึงเสนอระบบเราเตอร์ที่ใช้วิธีประเมินเวลาการทำงานส่วนเกินจากปัจจัยต่างๆ เช่น ความยาวของ prompt, การคาดการณ์ความยาวของ output, แรงกดดันของ KV cache และระดับ SLO

จากการทดสอบในเครื่องจำลองและตรวจสอบกับ GPU NVIDIA A40 จำนวน 8 ตัว พบว่าเราเตอร์ที่ผ่านการปรับเทียบแล้วสามารถทำค่าเฉลี่ย goodput ได้สูงสุดที่ 0.864 เมื่อเทียบกับวิธีดั้งเดิมอย่าง round robin หรือ least loaded นอกจากนี้ยังพบว่าการปรับเทียบฮาร์ดแวร์มีความสำคัญมาก หากใช้ค่าคงที่จากเครื่องจำลองเพียงอย่างเดียวจะทำให้ประสิทธิภาพลดลงอย่างเห็นได้ชัด ระบบนี้จะมีประโยชน์อย่างยิ่งเมื่อขนาดของกลุ่ม GPU สำหรับ decode ใหญ่ขึ้นและมีลักษณะการใช้งานที่หลากหลาย

สรุปประเด็นหลัก

เสนอระบบเราเตอร์ 'Calibrate, Then Route' สำหรับจัดการ GPU pools ในการรัน LLM

ทำค่าเฉลี่ย goodput ได้สูงถึง 0.864 เหนือกว่าวิธี round robin และ least loaded

พิสูจน์ว่าการปรับเทียบกับฮาร์ดแวร์จริง (Hardware Calibration) สำคัญกว่าการใช้ค่าจากเครื่องจำลอง

นวัตกรรมและเทคโนโลยี

infrastructure

Calibrated Request Routing

ระบบจัดการคำขอที่ประเมินเวลาจบงานจากความยาว prompt, ปริมาณ KV cache และระดับ SLO เพื่อเลือก GPU ที่เหมาะสมที่สุด

Developer Impact
ช่วยให้วิศวกรระบบและทีม MLOps สามารถออกแบบระบบ Serving ที่มีประสิทธิภาพสูงขึ้น ลดความผันผวนของ Latency และจัดการทรัพยากร GPU ได้คุ้มค่ากว่าเดิม
Keywords
#llm serving #request routing #gpu optimization #disaggregated serving #vllm
Original Source

อ่านข้อมูลเพิ่มเติมจากแหล่งข่าวหลัก

arXiv