Back to papers
April 10, 2026cs.CLcs.AIcs.LG
Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
Hadas Orgad, Boyi Wei, Kaden Zheng, Martin Wattenberg, Peter Henderson, Seraphina Goldfarb-Tarrant, Yonatan Belinkov
HF Upvotes
4
Categories
cs.CL, cs.AI, cs.LG