Transferable latency prediction for fast LLM screening on heterogeneous edge devices
Read the original at arxiv.org→arXiv:2607.21602v1 Announce Type: new Abstract: Accurate latency prediction is critical for deploying large language models (LLMs) on heterogeneous edge devices, where inference latency is affected by model...
Original headline: "Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices"
Coverage timeline
- Jul 27, 04:00 UTC arXiv cs.AI lead source Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices