FlowBalance: verifier-grounded self-improvement from on-policy reasoning experience
Read the original at arxiv.org→arXiv:2609.03241v1 Announce Type: new Abstract: A reasoning model can improve from its own on-policy experience, but this inner loop is fragile: terminal verifiers provide reliable yet sparse supervision, while...
Original headline: "FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience"
Coverage timeline
- Sep 4, 04:00 UTC arXiv cs.LG lead source FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience