AlignDiff uses intrinsic model signals to filter preference data for better alignment with human preferences
Read the original at arxiv.org→arXiv:2609.05899v1 Announce Type: new Abstract: Aligning large language models with human preferences remains a challenge, primarily due to the critical role of preference data quality in effective alignment....
Original headline: "AlignDiff: Exploiting Model-Intrinsic Information for Better Preference Data Selection"
Coverage timeline
- Sep 9, 04:00 UTC arXiv cs.CL lead source AlignDiff: Exploiting Model-Intrinsic Information for Better Preference Data Selection