MaD-RL: Matching Distributions for Calibrating LLMs with Reinforcement Learning
Read the original at arxiv.org→arXiv:2609.31644v1 Announce Type: new Abstract: Reinforcement learning (RL) is widely used in language-model post-training to maximize rewards assigned to individual model outputs, such as scores from binary...
Coverage timeline
- Sep 29, 04:00 UTC arXiv cs.LG lead source MaD-RL: Matching Distributions for Calibrating LLMs with Reinforcement Learning