Back to papers
June 24, 2026cs.CL

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

Categories

cs.CL