Linear probes detect corrupted context in language models but do not reliably predict final answer correctness across multi-hop arithmetic chains.
Read the original at arxiv.org→arXiv:2608.07528v1 Announce Type: new Abstract: Linear probes detect corrupted context in language models with near-perfect accuracy, yet this does not translate into reliable failure prediction. The result is a...
Original headline: "The Knowing-Saying Gap: When Probes See Errors that Confidence Misses"
Coverage timeline
- Aug 11, 04:00 UTC arXiv cs.AI lead source The Knowing-Saying Gap: When Probes See Errors that Confidence Misses