Data-DPO: Direct Preference Optimization for target model data selection in LLM post-training
Read the original at arxiv.org→arXiv:2608.16926v1 Announce Type: new Abstract: Data selection in supervised fine-tuning aims to select a small set of effective samples from large-scale candidate data, reducing training cost while preserving model...
Original headline: "Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training"
Coverage timeline
- Aug 19, 04:00 UTC arXiv cs.LG lead source Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training