Pipeline choices dominate autointerpretability score variance in sparse autoencoder evaluations
Read the original at arxiv.org→arXiv:2607.19386v1 Announce Type: new Abstract: Cross-paper comparison of sparse autoencoder (SAE) interpretability often relies on autointerpretability scores. In this evaluation pipeline, a language model (LM)...
Original headline: "Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance"
Coverage timeline
- Jul 23, 04:00 UTC arXiv cs.LG lead source Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance