Discrete action space as a prerequisite for GRPO convergence in small-model continuous control
Read the original at arxiv.org→arXiv:2607.21626v1 Announce Type: new Abstract: We study whether Group Relative Policy Optimization (GRPO) can fine-tune small language models for simulated quadrotor continuous-control tasks. In our benchmark,...
Original headline: "Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control"
Coverage timeline
- Jul 27, 04:00 UTC arXiv cs.AI lead source Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control