Back to papers
August 17, 2026cs.AIcs.CL

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

Categories

cs.AI, cs.CL