VERPO: Verified Evidence Regularized Policy Optimization
arXiv:2609.06100v4 Announce Type: replace-cross Abstract: Verifiable rewards improve language models through reliable task-level feedback, but methods based on Group Relative Policy Optimization (GRPO) apply a sequence-level advantage uniformly across all tokens. This coarse credit assignment…