Search papers, labs, and topics across Lattice.
Affiliation:
2
0
4
Fragmented defenses against LLM backdoor attacks stem from fundamental differences in how clean and dirty-label attacks manipulate model features.
ARENA uncovers vulnerabilities in large audio-language models that traditional text-based red-teaming methods miss, achieving near-perfect safety metrics across multiple systems.