Procedural fairness failures in RLHF from preference averaging
Read the original at arxiv.org→arXiv:2608.10126v1 Announce Type: new Abstract: Reinforcement Learning from Human Feedback (RLHF) aggregates heterogeneous preferences into a single reward model, assuming preference homogeneity. When preferences...
Original headline: "Procedural Fairness Failures in RLHF from Preference Averaging"
Coverage timeline
- Aug 12, 04:00 UTC arXiv cs.LG lead source Procedural Fairness Failures in RLHF from Preference Averaging