PlanPO: Group planning-aware policy optimization for multi-turn agentic LLMs
Read the original at arxiv.org→arXiv:2608.17289v1 Announce Type: new Abstract: Group-relative policy optimization has emerged as a key paradigm for training agentic large language models (LLMs) on multi-turn interactive tasks. However, most...
Original headline: "PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs"
Coverage timeline
- Aug 19, 04:00 UTC arXiv cs.AI lead source PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs