Progress-conditioned group policy optimization for long-horizon agentic tasks
Read the original at arxiv.org→arXiv:2607.22724v1 Announce Type: new Abstract: Group-based policy optimization has been increasingly used to train large language model (LLM) agents from sparse outcome rewards by comparing trajectories or steps...
Original headline: "Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks"
Coverage timeline
- Jul 28, 04:00 UTC arXiv cs.LG lead source Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks