Search papers, labs, and topics across Lattice.
Dots Studio, Xiaohongshu Inc, Shanghai Jiao Tong University, Xiaohongshu Inc. Tsinghua university
Tsinghua AI2
0
2
Token-level learning dynamics, not just model size, dictate scaling laws in language models, revealing actionable insights for training optimization.
NITP achieves a remarkable 5.7% performance boost on MMLU-Pro by transforming how LLMs are trained, moving beyond sparse supervision to dense semantic predictions.