Inference-time policy alignment for fair reinforcement learning
Read the original at arxiv.org→arXiv:2608.00175v1 Announce Type: new Abstract: Deep reinforcement learning (RL) agents achieve strong performance by optimizing scalar reward functions. However, once deployed, the policies of these RL agents are...
Original headline: "Inference-Time Policy Alignment for Fair Reinforcement Learning"
Coverage timeline
- Aug 4, 04:00 UTC arXiv cs.LG lead source Inference-Time Policy Alignment for Fair Reinforcement Learning