MeRLa: Meta-learned reward shaping for reinforcement learning from human feedback
Read the original at arxiv.org→arXiv:2607.26094v1 Announce Type: new Abstract: Reinforcement Learning from Human Feedback (RLHF) is the standard approach for aligning large language models with human preferences, but its quality is limited by...
Original headline: "Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback"
Coverage timeline
- Jul 30, 04:00 UTC arXiv cs.LG lead source Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback