Search papers, labs, and topics across Lattice.
Zhejiang University
1
0
3
DreOPD achieves superior performance by transforming reward extrapolation into stable velocity regression, outperforming traditional methods and specialized teachers alike.