การให้บริการโมเดลภาษาขนาดใหญ่ (LLM) ให้มีค่า Latency ต่ำและ Throughput สูงท่ามกลางความต้องการที่ผันผวนเป็นความท้าทายทางวิศวกรรมที่สำคัญ งานวิจัยนี้นำเสนอ FineServe ซึ่งเป็นชุดข้อมูลที่รวบรวมพฤติกรรมการใช้งานจริงจากแพลตฟอร์มการค้าทั่วโลก ครอบคลุมทั้งโมเดลและประเภทงานที่หลากหลาย
การวิเคราะห์ผ่าน FineServe พบว่าลักษณะการเรียกใช้งาน (Arrival Dynamics) และพฤติกรรมของ Token มีความแตกต่างกันอย่างสิ้นเชิงตามสถาปัตยกรรมของโมเดลและวัตถุประสงค์การใช้งาน นอกจากชุดข้อมูลแล้ว ทีมวิจัยยังได้พัฒนาเครื่องมือสร้างภาระงาน (Workload Generator) เพื่อให้นักพัฒนาระบบสามารถนำไปใช้จำลองสถานการณ์จริงในการทดสอบอัลกอริทึมการจัดการทรัพยากร (Scheduling) และการวางแผนกำลังการผลิต (Capacity Planning) ได้อย่างแม่นยำ