Reference feature atlases for mechanistic auditing of language models
Read the original at arxiv.org→arXiv:2607.22570v1 Announce Type: new Abstract: Auditing a new language model usually means relearning and reinterpreting its internal features from scratch. We propose a reference feature atlas: a sparse feature...
Original headline: "Reference Feature Atlases for Mechanistic Auditing of Language Models"
Coverage timeline
- Jul 28, 04:00 UTC arXiv cs.AI lead source Reference Feature Atlases for Mechanistic Auditing of Language Models