Back to papers
June 9, 2026cs.LGcs.AI

Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning

HF Upvotes

41

Categories

cs.LG, cs.AI