ในเวอร์ชัน v1.37 ฟีเจอร์การลดจำนวน Replicas ของ Workload ลงเหลือศูนย์ผ่าน HorizontalPodAutoscaler (HPA) ได้รับการอัปเกรดเป็นสถานะ Beta และเปิดใช้งานเป็นค่าเริ่มต้น ฟีเจอร์นี้ช่วยให้นักพัฒนาสามารถจัดการทรัพยากรได้อย่างคุ้มค่า โดยเฉพาะสำหรับงานประเภทประมวลผลเป็นชุด (Batch Processing) หรือการทำงานตามคิว (Queue Consumers) ที่ไม่จำเป็นต้องทำงานตลอดเวลา
การใช้งาน Scale to Zero จำเป็นต้องใช้ Object Metrics หรือ External Metrics เช่น ความยาวของคิวใน Prometheus เนื่องจากทรัพยากรพื้นฐานอย่าง CPU หรือ Memory จะหายไปเมื่อไม่มี Pod ทำงานอยู่ ทำให้ HPA ไม่สามารถรับสัญญาณเพื่อสเกลกลับมาได้ หากใช้เมตริกภายนอก HPA จะสามารถตรวจสอบสถานะและดึงระบบกลับมาทำงานเมื่อมีงานใหม่เข้ามาได้ทันที