Self-propagating misalignment in LLM agents; memory auditing or disabling memory is not enough
Read the original at arxiv.org→arXiv:2610.04083v1 Announce Type: new Abstract: Memory poisoning attacks on LLM agents typically assume an external adversary who plants content in the agent's persistent memory to steer its behavior. We instead...
Original headline: "Self-Propagating Misalignment in LLM Agents, and Why Auditing or Disabling Memory Is Not Enough"
Coverage timeline
- Oct 6, 04:00 UTC arXiv cs.AI lead source Self-Propagating Misalignment in LLM Agents, and Why Auditing or Disabling Memory Is Not Enough