Search papers, labs, and topics across Lattice.
This paper introduces Easper, an open-source, no-code ASR pipeline designed to empower linguists in language documentation by enabling them to fine-tune multilingual ASR models directly from ELAN annotations. The study addresses the cold start problem in ASR deployment by evaluating transcription prioritization strategies for three Vanuatu languages, revealing that prioritizing lexically rich narratives and enhancing acoustic-phonetic repetition significantly improves transcription quality. The key finding indicates that these strategies lead to faster improvements in Character Error Rate, even in challenging acoustic conditions.
Prioritizing lexically rich narratives can accelerate ASR transcription quality improvements by overcoming the cold start problem in language documentation.
Audio transcription is a critical bottleneck in language documentation. While multilingual Automatic Speech Recognition (ASR) models like Whisper offer solutions, field linguists often lack the expertise to utilise them. We present Easper, an open-source, no-code workflow enabling linguists to iteratively fine-tune ASR models via cloud resources directly from ELAN annotations. Deploying ASR also raises a cold start problem: deciding which recordings to transcribe first to bootstrap an accurate model. Using Easper, we evaluate transcription prioritisation strategies on three Vanuatu languages (Bislama, Nafsan, Nguna). We fine-tune models by recording session, comparing Character Error Rate trajectories when prioritising acoustic cleanliness versus linguistic richness. We demonstrate that prioritising lexically rich narratives and increasing acoustic-phonetic repetition, even in noisy environments, leads to faster improvements in transcription quality.