Boundary-Seeking Policy Gradient for safe reinforcement learning
Read the original at arxiv.org→arXiv:2608.10204v1 Announce Type: new Abstract: Safe reinforcement learning maximizes reward subject to safety constraints. For Constrained Markov Decision Processes, the linear-programming view over occupancy...
Original headline: "Boundary-Seeking Policy Gradient for Safe Reinforcement Learning"
Coverage timeline
- Aug 12, 04:00 UTC arXiv cs.LG lead source Boundary-Seeking Policy Gradient for Safe Reinforcement Learning