ESQ-Bench: an Oracle-first NL2SQL benchmark with multi-tier complexity and silent-divergence evaluation for dialect generalization and enterprise schemas
Read the original at arxiv.org→arXiv:2608.23569v1 Announce Type: new Abstract: State-of-the-art Natural Language to SQL (NL2SQL) models report execution accuracy exceeding 89 percent on established benchmarks such as Spider and BIRD. However,...
Original headline: "ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect Generalization and Silent Semantic Divergence"
Coverage timeline
- Aug 26, 04:00 UTC arXiv cs.AI lead source ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect Generalization and Silent Semantic Divergence