Search papers, labs, and topics across Lattice.
CISPA Helmholtz Center for Information Security
3
0
5
Extracting hidden reasoning traces from black-box models is not only feasible but poses a substantial security risk, with EchoCoT achieving over 66% accuracy in retrieval.
Existing moderation systems miss over 65% of hateful narratives in multi-turn visual stories, underscoring a critical gap in AI safety.
Even the most advanced LLMs like GPT-5.2 and Gemini-3-Pro often fail to recognize and refuse to process harmful content embedded within seemingly harmless tasks.