Decoy direction optimization: a post-hoc defense against LLM abliteration
Read the original at arxiv.org→arXiv:2609.16204v1 Announce Type: new Abstract: Safety guardrails in open-weight language models can be readily bypassed using Refusal Feature Ablation (RFA), a technique that identifies and projects out a linear...
Original headline: "Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration"
Coverage timeline
- Sep 16, 04:00 UTC arXiv cs.LG lead source Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration