Anchoring bias: a persistent fairness backdoor attack against MLLMs under continual learning
Read the original at arxiv.org→arXiv:2608.21577v1 Announce Type: new Abstract: Multimodal Large Language Models (MLLMs) are increasingly deployed in high-stakes domains where fairness is a critical safety requirement. In practice, these models...
Original headline: "Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning"
Coverage timeline
- Aug 25, 04:00 UTC arXiv cs.LG lead source Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning