Search papers, labs, and topics across Lattice.
Holistic AI, University College London
2
0
3
Fourteen out of sixteen large language models exhibit a systematic optimism bias in their probability judgments, raising concerns about their reliability as decision aids.
Single-token SAE features can significantly impact model outputs, with their causal roles varying dramatically across different SAE families.