DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages
TL;DR - DONDO is a family of openly licensed w2v-BERT 2.0 speech-recognition models covering 27 African language varieties. Its multilingual models achieve average word error rates of 10–13%, approaching monolingual performance while consolidating multiple languages into single checkpoints.
- Includes 21 monolingual and five multilingual models across six African countries.
- Uses learning-rate-annealed fine-tuning to recover or surpass strong monolingual baselines.
- Supports inference-time language steering through lightweight one-hot language-prefix frames.
- Released under Apache-2.0 on Hugging Face for unrestricted fine-tuning, including commercial use.