Narrative wrapping affects LLM refusals; cross-language benchmark GUISE measures vulnerability across English, modern Chinese, and Classical Chinese
Read the original at arxiv.org→arXiv:2610.11005v1 Announce Type: new Abstract: Safety-aligned language models often refuse a harmful request stated directly but answer the same request inside a role-play or narrative wrapper. We measure this...
Original headline: "How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense"
Coverage timeline
- Oct 9, 04:00 UTC arXiv cs.AI lead source How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense