Back to papers
April 3, 2026cs.LGcs.AIcs.CL

Mitigating Reward Hacking in RLHF via Advantage Sign Robustness

Categories

cs.LG, cs.AI, cs.CL