Multilingual safety signals are multi-layered: filtering safety-degrading data for safer LLMs
Read the original at arxiv.org→arXiv:2609.22144v1 Announce Type: new Abstract: Preserving safety alignment during large language models fine-tuning is critical, however, recent studies have demonstrated that even benign fine-tuning data may...
Original headline: "Multilingual Safety Signals Are Multi-Layered: Filtering Safety-Degrading Data for Safer LLMs"
Coverage timeline
- Sep 22, 04:00 UTC arXiv cs.CL lead source Multilingual Safety Signals Are Multi-Layered: Filtering Safety-Degrading Data for Safer LLMs
- Sep 22, 04:00 UTC arXiv cs.LG Weak Ties, Strong Signals: Efficient Training Data Detection in Diffusion LLMs via Independent Token Sampling