A year in LLM serving: workload evolution, caching and load-balancing
Read the original at arxiv.org→arXiv:2608.13573v1 Announce Type: new Abstract: Large Language Model (LLM) serving has become a critical cloud workload, and realistic traces are essential for motivating and benchmarking serving systems. However,...
Original headline: "A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing"
Coverage timeline
- Aug 17, 04:00 UTC arXiv cs.AI lead source A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing