Search papers, labs, and topics across Lattice.
Affiliation:
2
0
3
Neural networks exhibit an internal "feeling of error"鈥攎anifesting as sharply suppressed concept activations inside Sparse Autoencoders鈥攖hat reliably flags segmentation failures where standard output uncertainty metrics fail.
Model internals, not just outputs, hold the key to predicting generalization: circuit-based metrics beat standard proxies by up to 34% in assessing ViT performance under distribution shift.