Back to papers
April 8, 2026cs.AIcs.LG

Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization

Categories

cs.AI, cs.LG