Search papers, labs, and topics across Lattice.
Nanjing University of Aeronautics and Astronautics
2
0
4
Uncertainty-aware querying can significantly stabilize policy updates in offline reinforcement learning, leading to improved performance without additional environment interaction.
LLM reasoning can be compressed without sacrificing accuracy by selectively encouraging exploration only on difficult questions, preventing premature entropy collapse.