Search papers, labs, and topics across Lattice.
Zhejiang University
3
0
3
Adversaries can exploit multimodal guardrails to misclassify safe inputs as unsafe, achieving an alarming 84% success rate in disrupting service availability.
Backdoor attacks can generalize across trigger families, with Lilith achieving high success rates while preserving benign model performance.
Malicious LoRA plugins can hijack public sentiment and spread harmful content, achieving nearly 100% success rates without detection.