Training-time explainability for multilingual hate speech detection aligns model reasoning with human rationales
Read the original at arxiv.org→arXiv:2608.26125v1 Announce Type: new Abstract: Online hate against Muslim communities often appears in culturally coded, multilingual forms that evade conventional AI moderation. Such systems, though accurate,...
Original headline: "Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales"
Coverage timeline
- Aug 28, 04:00 UTC arXiv cs.CL lead source Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales
- Aug 28, 04:00 UTC arXiv cs.CL Beyond Accuracy: A Qualitative Analysis of Vision-Language Models for Hate Speech Detection in Memes