Back to papers
June 8, 2026cs.CLcs.AIcs.LG

Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

Categories

cs.CL, cs.AI, cs.LG