Search papers, labs, and topics across Lattice.
Princeton University
2
0
4
Fine-tuning can lead to alignment collapse even when using benign tasks, with second-order effects proving more dangerous than previously understood.
Fine-tuning can unexpectedly break safety guardrails because alignment concentrates in brittle, low-dimensional subspaces, causing gradient descent to steer models into alignment-sensitive regions despite initial orthogonality.