Search papers, labs, and topics across Lattice.
This paper introduces CRAW, a codec-robust audio watermarking framework designed to enhance the resilience of audio watermarks against neural codecs and denoisers while preserving high perceptual quality. By integrating distortion-aware training, attention-based pooling, and error-correcting codes, CRAW effectively mitigates fidelity loss during robust training. Experimental results show that CRAW outperforms existing post-hoc watermarking techniques in terms of robustness and maintains comparable audio quality, addressing a critical need in the fight against audio misinformation.
CRAW achieves state-of-the-art resilience against neural audio transformations while keeping audio quality intact, a game-changer for combating synthetic audio fraud.
Recent advances in generative speech models have made it increasingly difficult to distinguish authentic from synthetic audio, enabling new forms of fraud and misinformation. Audio watermarking offers a promising defense by embedding an imperceptible signal into generated speech that can later be detected to verify its provenance. However, recent studies have shown that existing post-hoc watermarking methods fail under neural codecs and denoisers, transformations routinely applied during real-world storage, transmission, and processing, severely limiting their practical utility. Here we introduce CRAW, a codec-robust audio watermarking framework that jointly improves robustness against neural re-synthesis while maintaining high perceptual quality. CRAW combines distortion-aware training with an attention-based pooling mechanism, inference-time perceptual mask- ing, and an error-correcting code to recover the fidelity lost during robust training. Experiments demonstrate that CRAW achieves state-of-the-art robustness against neural codecs, denoisers, and vocoders while maintaining perceptual quality comparable to existing post-hoc watermarking methods. The code is available at https://github.com/DavidC1212/craw.