Adversarial style optimization: enhancing VLM jailbreaks by GRPO-based stylistic triggers optimization
Read the original at arxiv.org→arXiv:2607.21619v1 Announce Type: new Abstract: Multimodal Large Language Models (MLLMs) have achieved impressive performance, but their safety alignment remains vulnerable to jailbreak attacks. Existing...
Original headline: "Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization"
Coverage timeline
- Jul 27, 04:00 UTC arXiv cs.CL lead source Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization