Search papers, labs, and topics across Lattice.
3
0
4
CRPO effectively mitigates exposure bias in self-distillation, leading to superior performance in complex reasoning tasks.
Process evaluations reveal hidden failures in LLM reasoning, showing that lucky successes can mask critical deficiencies in agent performance.
ISPO reduces critical reasoning failures in RLVR by transforming reward structures, leading to superior performance on complex reasoning tasks.