EvalDetectBench benchmarks evaluation awareness in frontier language models; open pipeline supports Inspect-compatible evaluation
Read the original at arxiv.org→arXiv:2609.01611v1 Announce Type: new Abstract: Frontier large language models can often recognize when they are being evaluated, a capability known as evaluation awareness. If models behave differently in...
Original headline: "EvalDetectBench: A Benchmark for Measuring Evaluation Awareness in Frontier Language Models"
Coverage timeline
- Sep 3, 04:00 UTC arXiv cs.AI lead source EvalDetectBench: A Benchmark for Measuring Evaluation Awareness in Frontier Language Models