Search papers, labs, and topics across Lattice.
The Chinese University of Hong Kong
1
0
2
2
Scaling native multimodal pre-training reveals that text-heavy data mixtures require larger models for optimal efficiency, challenging conventional resource allocation strategies.