Search papers, labs, and topics across Lattice.
University of Texas at Austin
1
0
2
7
Cooperative multi-agent training can unlock unsupervised reasoning capabilities in RL, yielding performance gains that rival supervised methods without the need for costly annotations.