Back to papers
April 14, 2026cs.CL

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood

Categories

cs.CL