DeltaML-Bench benchmarks autonomous ML agents across 48 tasks from research papers to improve published baselines in imperfect, open-source repositories
Read the original at arxiv.org→arXiv:2608.19653v1 Announce Type: new Abstract: Autonomous agents for machine learning experimentation must navigate heterogeneous repositories, repair training pipelines, and evaluate candidate improvements under...
Original headline: "DeltaML-Bench: Evaluating Machine Learning Agents on Real-World Research Repositories"
Coverage timeline
- Aug 21, 04:00 UTC arXiv cs.LG lead source DeltaML-Bench: Evaluating Machine Learning Agents on Real-World Research Repositories