Search papers, labs, and topics across Lattice.
2
0
3
High-quality retrieval fails to guarantee correct reasoning in real-world QA systems, revealing critical vulnerabilities in their performance.
WAPO leverages token-level gradient dynamics to stabilize RLVR training, achieving superior performance in reasoning tasks while addressing collapse risks.