Search papers, labs, and topics across Lattice.
Affiliation:
2
0
3
RTPO eliminates critical instability in multi-turn RL training, achieving over 21% performance improvement compared to traditional methods.
Achieve expert-level MARL coordination on resource-constrained devices: KD-MARL slashes computational costs by up to 28.6x without sacrificing performance.