Search papers, labs, and topics across Lattice.
Affiliation:
1
0
3
1
Penalizing shifts in safety representations during reasoning fine-tuning can restore LLM safety without sacrificing performance, revealing a critical interplay between reasoning and safety in model training.