Search papers, labs, and topics across Lattice.
Aalto University
1
0
3
Static parallelism layouts leave massive post-training efficiency on the table, but dynamically re-slicing distributed model states across GPUs cuts RL step latency by 28% with less than 0.1% transition overhead.