Search papers, labs, and topics across Lattice.
Affiliation:, University of Texas San Antonio
1
0
2
23
Covert coordination among language-model agents can be effectively monitored and mitigated without prior training on attack examples, achieving near-perfect detection rates.