Back to papers
July 30, 2026cs.LG

HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks

Categories

cs.LG