Search papers, labs, and topics across Lattice.
Affiliation:
5
0
8
9
Achieving a 5.1x speedup in a legacy weather simulation while ensuring scientific validity reveals the critical role of validation in AI-assisted GPU porting.
Achieving up to 2.1 percentage points improvement in classification accuracy by optimizing SVM formulations across multiple quantum-inspired annealers reveals the critical interplay between parameter selection and backend performance.
Deopt-Reopt can significantly accelerate CUDA translation for certain HPC kernels, but its advantages are kernel-dependent and not universally applicable.
LLMs generating code from a shared prefix exhibit surprisingly high MoE routing similarity even when producing different tokens, but this similarity varies significantly across layers, revealing potential optimization points.
Forget synthetic benchmarks – this work trains LLMs to write faster HPC code by directly rewarding GFLOPS measured on a real supercomputer.