Shared actors need not share critics; value mismatch across environments in parallel reinforcement learning
Read the original at arxiv.org→arXiv:2608.26481v1 Announce Type: new Abstract: When a single policy is trained in parallel across multiple environments of the same task, such as procedurally generated levels, randomized dynamics, or curricula,...
Original headline: "Shared Actors Need Not Share Critics: Effects of Value Mismatch in Parallel Reinforcement Learning"
Coverage timeline
- Aug 28, 04:00 UTC arXiv cs.LG lead source Shared Actors Need Not Share Critics: Effects of Value Mismatch in Parallel Reinforcement Learning