Search papers, labs, and topics across Lattice.
4
0
8
6
Multi-axis max@K boosts image diversity and fairness in text-to-image generation, enhancing representation without sacrificing quality.
Centering advantages in policy gradients can drastically reduce variance and improve performance in reinforcement learning tasks.
OrderGrad transforms policy-gradient optimization by enabling precise control over distributional properties, allowing for risk-averse and exploratory learning in real-world applications.
Discontinuous dynamics aren't the biggest problem for policy gradients in differentiable simulators; variance control often matters more.