Search papers, labs, and topics across Lattice.
The University of Hong Kong
2
0
5
Robots can master delicate tool manipulation directly from unpaired human videos, achieving a 73% performance leap over SOTA by anchoring control in object-centric 3D pose priors rather than raw end-to-end pixels.
Cloud-based vision-language models leak raw screenshots for privacy arbitration, but MaskClaw offers a practical edge-side alternative that learns from user feedback.