NeuronFuzz: Safety neuron guided fuzzing for LLM safety evaluation
Read the original at arxiv.org→arXiv:2608.26222v1 Announce Type: new Abstract: Safety evaluation is critical for assessing whether aligned Large Language Models (LLMs) remain robust against jailbreak attacks. Existing automated testing methods,...
Original headline: "NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation"
Coverage timeline
- Aug 28, 04:00 UTC arXiv cs.LG lead source NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation