DataPrep-Bench benchmarks LLMs as training data preparators; evaluates data construction and data quality evaluation end to end
Read the original at arxiv.org→arXiv:2607.20465v1 Announce Type: new Abstract: The quality of training data fundamentally determines the capabilities of large language models (LLMs), yet no unified benchmark exists to measure how well LLMs,...
Original headline: "DataPrep-Bench: Benchmarking LLMs as Training Data Preparators"
Coverage timeline
- Jul 24, 04:00 UTC arXiv cs.LG lead source DataPrep-Bench: Benchmarking LLMs as Training Data Preparators