Mitigating LLM over-refusal via dynamic semantic routing calibration
Read the original at arxiv.org→arXiv:2609.25049v1 Announce Type: new Abstract: Large language models (LLMs) aligned for safety often suffer from over-refusal, incorrectly rejecting benign yet safety-related instructions. Prior studies primarily...
Original headline: "Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibratione"
Coverage timeline
- Sep 23, 04:00 UTC arXiv cs.CL lead source Mitigating LLM Over-Refusal via Dynamic Semantic Routing Calibratione