OnlineQAT: on-policy distillation for ultra-low-bit large language models
Read the original at arxiv.org→arXiv:2610.09346v1 Announce Type: new Abstract: Quantization-aware training (QAT) can recover much of the accuracy lost when large language models are compressed below four bits. Existing re- covery stages, however,...
Original headline: "OnlineQAT: On-Policy Distillation for Ultra-Low-Bit Large Language Models"
Coverage timeline
- Oct 8, 04:00 UTC arXiv cs.CL lead source OnlineQAT: On-Policy Distillation for Ultra-Low-Bit Large Language Models
- Oct 8, 04:00 UTC arXiv cs.LG GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents