SeDeM: selective decompression of hidden-state memories for long-context question answering
Read the original at arxiv.org→arXiv:2608.00311v1 Announce Type: new Abstract: Long-context inference with large language models (LLMs) is costly: self-attention during prefill scales quadratically with sequence length, and the key-value (KV)...
Original headline: "SeDeM: Selective Decompression of Hidden-State Memories for Long-Context Question Answering"
Coverage timeline
- Aug 4, 04:00 UTC arXiv cs.CL lead source SeDeM: Selective Decompression of Hidden-State Memories for Long-Context Question Answering