InferenceBench: a benchmark for open-ended LLM inference optimization by AI agents
Read the original at arxiv.org→arXiv:2607.20468v1 Announce Type: new Abstract: AI agents are increasingly used to automate research and development tasks, yet existing benchmarks typically evaluate them on prescribed workflows or narrow action...
Original headline: "InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents"
Coverage timeline
- Jul 24, 04:00 UTC arXiv cs.AI lead source InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents