Activation Oracles learn not to read: concept-specific blind spots in fine-tuned oracles
Read the original at arxiv.org→arXiv:2607.23379v1 Announce Type: new Abstract: Activation Oracles (AOs) are language models trained to answer natural-language questions about another model's internal activations. They offer a flexible interface...
Original headline: "When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles"
Coverage timeline
- Jul 28, 04:00 UTC arXiv cs.CL lead source When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles