Search papers, labs, and topics across Lattice.
2
0
4
Adversarial training with human demonstrations can significantly enhance the quality and diversity of language model outputs while preserving accuracy.
LLMs trained with Vector Policy Optimization (VPO) learn to produce diverse solutions that unlock previously unsolvable problems in evolutionary search, outperforming models optimized for single scalar rewards.