Back to papers
June 29, 2026cs.LGcs.AIstat.ML

Pessimism's Paradox: Conservative Offline Training Amplifies Reward Hacking During Online Adaptation in Reasoning Models

Categories

cs.LG, cs.AI, stat.ML