Search papers, labs, and topics across Lattice.
LLM Department, Tencent
1
0
2
4
Scaling native multimodal pre-training reveals that text-heavy data mixtures require larger models for optimal efficiency, challenging conventional resource allocation strategies.