Search papers, labs, and topics across Lattice.
Affiliation:
2
0
6
Sampling rollouts via GRPO actively degrades tool-selection training as policies concentrate, whereas exact policy optimization over enumerable combinatorial tool spaces eliminates vanishing gradients and boosts accuracy by up to 14.2 points.
Adaptive similarity margins in HN-CLIP boost retrieval accuracy by up to 4.3% while training 2.4x faster than leading methods.