Continuity-free near-minimax leading-order regret for CVaR-UCBVI
Read the original at arxiv.org→arXiv:2608.28960v1 Announce Type: new Abstract: For finite-horizon tabular CVaR reinforcement learning, prior work proves a $\widetilde{O}(\tau^{-1}\sqrt{SAK})$ leading regret bound for arbitrary normalized return...
Original headline: "Continuity-Free Near-Minimax Leading-Order Regret for CVaR-UCBVI"
Coverage timeline
- Sep 1, 04:00 UTC arXiv cs.LG lead source Continuity-Free Near-Minimax Leading-Order Regret for CVaR-UCBVI