Adaptive multi-value control in LLMs via causal activation steering
Read the original at arxiv.org→arXiv:2609.30405v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly deployed in settings where responses must reflect multiple, potentially interacting social norms and human values....
Original headline: "Adaptive Multi-Value Control in LLMs via Causal Activation Steering"
Coverage timeline
- Sep 28, 04:00 UTC arXiv cs.LG lead source Adaptive Multi-Value Control in LLMs via Causal Activation Steering