How Do linear probes emerge? A circuit-tracing framework with concept-targeted attribution
Read the original at arxiv.org→arXiv:2608.27510v1 Announce Type: new Abstract: Transcoder attribution graphs are usually trained to explain why a model assigns high probability to a particular next token. We introduce Concept-Targeted Attribution...
Original headline: "How Do Linear Probes Emerge? A Circuit-Tracing Framework with Concept-Targeted Attribution"
Coverage timeline
- Aug 31, 04:00 UTC arXiv cs.CL lead source How Do Linear Probes Emerge? A Circuit-Tracing Framework with Concept-Targeted Attribution