Back to papers
July 28, 2026cs.LGcs.AIcs.CL

Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models

Categories

cs.LG, cs.AI, cs.CL